注册并分享邀请链接,可获得视频播放与邀请奖励。

Panda@Cerul.ai 的个人资料封面
Panda@Cerul.ai 的头像

[email protected] (@Jiaxi_Cui)

@Jiaxi_Cui
0 正在关注    0 粉丝
当时上海解封不久,从第一家创业公司辞职,积累了大量多模态视频的经验,彼时觉得未来一片坦途 抽空把大五的毕业证领了,虽然没在本科待过多久 攒了点钱在黄岛度假,拿了雅思、GRE,申了一些学校 拒了 MSRA,当时还算是学术圈的黄埔军校 不知为何是一个极其热闹的时间点,大家都走在重要的分叉路口。没有休学的朋友马上要开学,看他们晒的雁栖湖、未名湖、紫金港真漂亮。前女友去了英国,有从美国回来商科转码的高中朋友,有对国内失望申北欧 PhD 躺平的朋友,回美国的 leader,去新加坡的同事,被裁后在移民日本的老领导 茫茫天地似乎哪里都去得,都是没听过的路 我的重大改变都发生在四年前
显示更多
GPT-4 finished training four years ago today.
0
63
162
8
转发到社区
所以应该远离那些,认为现在的学术论文还有价值的人 (当然,仍然有很多高价值工作,但它们哪怕挂在 Arxiv 甚至写个blog 可能也有同样的传播力)
看了篇ICLR2026的论文,怎么也想不到效果为什么那么好,正好代码开源了, 一看是用测试集标签选参数...这就是顶会吗:)
0
47
42
1
转发到社区
22 年 ChatGPT 发布以来,字节是第一个苏醒的大厂,在早期就奠定了Seed-火山-豆包权责分明的三角架构 今年以 WorkBuddy 为号角,腾讯也苏醒了,并且 hy3 的模型能力稳步上升,开始向流水高的应用侧蚕食。高返佣 + 密集地推的老一辈打法,虽然无赖但有效,创业公司慢慢回想起了大厂的恐怖 预计明年阿里和美团也会陆续恢复战斗力,对相关的高流水 Startup 可谓是毁灭性打击了
显示更多
0
81
79
3
转发到社区
也是上过央视总台的人了,家人们
0
102
453
4
转发到社区
今天竟然碰到了赛博菩萨 @Cloudflare 的商务,非常震惊,cf 给人的感觉是纯做慈善,用户想用就自己注册自己付费来着 要了个合照,他们的包也太好看了
显示更多
0
47
185
2
转发到社区
晚上走在江边在想,人的一生中,在青壮年时期能赶上一波大浪潮是非常幸运的事情
0
67
242
17
转发到社区
我顶着一头银发被总台采访了,不会有什么负面影响吧😭
发现 Claude Code CLI 的检测好像比 APP 的检测要严,最近使用 CLI 被露头秒了,但用 Claude APP 一直都没啥事
“为什么 latent space 和自然语言空间之间没有其他表示层?” Claude 的 J-space,某种程度上回答了这个问题。 我之前说 text CoT 更像当前阶段的工程折中:好监督、好验证、好被 reward model 评估,也好被用户、媒体和投资人理解。 所以它能 scale,但不代表它是终点。 J-space 把问题往前推了一层。 模型不是全程在自然语言里 thinking,也不是完全在不可读的 latent space 里 thinking。更准确地说,它内部存在一个可语言化的 latent workspace。 大量底层计算发生在 latent space;但那些需要被复用、反思、审计、对齐的中间思想,会进入这个 workspace。 所以它在科学上未必神秘。steering vector、logit lens 之后,大家早就知道 residual stream 里能塞下大量未说出口的语义、倾向和中间状态。 但它在工程上非常恐怖。 传统 RL / RLHF / RLAIF,本质上是: prompt → model output → reward model 打分 → 更新模型 但如果 J-space 走通,训练范式可能变成: prompt → model internal J-space + output → critic 打分 → 更新模型 这不是训练模型最后说什么。 这是训练模型在关键时刻“应该意识到什么”。 以前我们训练模型的嘴。 现在可能开始训练模型的内心独白。 这才是 Anthropic 这篇最值钱的地方。 它不只是 interpretability,而是可能影响 RL、对齐、长期记忆、continuous learning、fine-tuning 本身 甚至更多这两三年我们习以为常的操作。 知识库是外挂,微调是重训。 但 J-space 如果成熟,可能会出现第三种东西:直接塑造模型在某类场景下会激活什么概念、记住什么经验、调用什么原则。 而值得注意的是这一篇工作似乎诞生于 Sonnet4.5 时代,Anthropic 比 OpenAI 更让人震撼。 我甚至能想到前段时间大量 Researcher 批量加入 Anthropic 的场景: """ X: "我不喜欢你们,你们是一家非常喜欢封号的公司" Claude: “要不你看看我们半年前研究的这些工作再说,但这些论文都接近 close 了,你进来肯定挂不上这些名了,但你可以自己探索新方向” X: "我什么时候可以入职!" """ 早期 OpenAI 迷人的地方,是 GPT-2、GPT-3、CLIP、Whisper 那种朴素但强大的信念: 用数据、规模和统一范式,打破之前学术界“架构优先”的惯性。 那时候的 OpenAI 很像一个有明确科学直觉的组织。它知道自己相信什么,也知道自己要把世界往哪个方向推。 但现在的 OpenAI 越来越像产品和算力公司,强是强,却越来越难感受到一套属于自己的科学理念。 Anthropic 反而还在追问更底层的问题,J-space 不是证明模型有灵魂,它想证明模型的“内心独白”可能可以做成 API。 一开始我还以为 J-space 只是随手起的名字,后来仔细看才发现这个 J 是 Jacobian。 这就太浪漫了。 Jacobian 把多元复杂函数在局部近似成可操作的线性函数;J-space 则像是在把模型内部高维、复杂、混沌的 latent space,投影成一组可以读取、干预、训练的方向。 这种命名的美感,让我想到 SpaceX。 其实我从高一开始关注到 Musk 的,那会我每周都会买很多杂志,在其中一期看到了他完整的创业记录,只是近几年所有人都认识他了,所以也不怎么提了。 当时令我印象深刻的倒不是今天熟悉的星舰,而是 2008 年 Falcon 1 的第四次发射。前三次全部失败,第四次几乎凑出了最后所有的钱做发射,包括 Tesla 那一次 Falcon 1 入轨,SpaceX 才活了下来。 后来他们把海上火箭回收船命名为 Of Course I Still Love You。这名字出自科幻小说,不是冷冰冰的工程代号,而像一句情书,去接住一枚从天上返回的火箭。 所以迷人的地方是极端硬核的工程、生死边缘的赌局,最后被一种近乎浪漫的命名接住。 科学、工程和浪漫,在这里突然接上了。 Author List 中 Wes Gurnee @wesg52 和 Jack Lindsey @Jack_W_Lindsey 构思了整套方法,以及语言表达与意识访问之间的联系,伟大无需多言。 有两位华人 Rowan Wang 和 Runjin Chen 参与了 Reflection 训练部分
显示更多
0
22
199
24
转发到社区
两年没发论文了,全靠遗产,4k 引用了🥰,感谢大伙
0
10
48
0
转发到社区
其实快速、简单的任务 Haiku 也不是不能用...
科普一下,之前 Claude API 是没有如此便宜的渠道的,当然逆向的不算 我要是加州政府,我就出来干中转站了(bushi
0
11
104
2
转发到社区
没怎么用 Claude 了,Opus 有太多可替代的模型了,但之前 Claude Design 是无可替代的 现在代码、文档都是 Codex 写,用 @dotey 的 baoyu-design 结合 glm5.2 做设计,大概能有 Claude Design 80%左右的水平,感觉很够用了,推荐一下
显示更多
Google 正在吃掉通用 Agent、跨文件理解+问答、剪辑等赛道
不怕大伙笑话,给 Cerul 做 Mac 桌面端 APP,以前没有过桌面开发经验,刚开始选了 Tauri,后来改成了 Electron 现在发现要实现自动更新需要 Apple 开发者账号,才知道 Mac APP 最好的框架是 Swift🤣 不管了先发 Electron 版本,后面再说吧
显示更多
0
30
32
0
转发到社区
打算用 Jina 新的 embedding 模型试试效果,打开论文第一页看到了我们三年前做的模型还在被对比,谁懂这种感觉😂
Built sth I've always wanted, using jina-v5-omni embeddings locally for multimodal file search on mac. + airgapped & fully local, indexes text, PDF, image, audio, and video + Swift-native UI + mlx-swift-transformer optimized core. No Python. + tested on M3 Pro 18G / M3 Ultra 512G / M4 Pro 48G. all work fine, no OOM + local HTTP server exposes index to agents like OpenClaw & Hermes
显示更多
我很喜欢 Qwen3-ASR-0.6B + Qwen3-ForcedAligner-0.6B 的组合,但如果他们加起来的参数量更小一点就好了 或许有人可以告诉我,如果我想通过后训练的方式,把 ASR 或者 ForcedAligner 模型参数量降低到原来的 30-50 % 而尽量不损失太多性能的话,应该怎么做吗
显示更多
注意:Claude Design 更新之后非常喜欢导出 HTML 版本,复现效果并不好 如果你是用来做前端复现,让他变成 React/Vue + class/Tailwind 的版本
0
39
18
0
转发到社区