注册并分享邀请链接,可获得视频播放与邀请奖励。

[email protected] (@Jiaxi_Cui) ““为什么 latent space 和自然语言空间之间没有其他表示层?” Claude 的 J-space,某种” — TopicDigg

Panda@Cerul.ai 的个人资料封面
Panda@Cerul.ai 的头像
@Jiaxi_Cui
加入 September 2020
0 正在关注    0 粉丝
“为什么 latent space 和自然语言空间之间没有其他表示层?” Claude 的 J-space,某种程度上回答了这个问题。 我之前说 text CoT 更像当前阶段的工程折中:好监督、好验证、好被 reward model 评估,也好被用户、媒体和投资人理解。 所以它能 scale,但不代表它是终点。 J-space 把问题往前推了一层。 模型不是全程在自然语言里 thinking,也不是完全在不可读的 latent space 里 thinking。更准确地说,它内部存在一个可语言化的 latent workspace。 大量底层计算发生在 latent space;但那些需要被复用、反思、审计、对齐的中间思想,会进入这个 workspace。 所以它在科学上未必神秘。steering vector、logit lens 之后,大家早就知道 residual stream 里能塞下大量未说出口的语义、倾向和中间状态。 但它在工程上非常恐怖。 传统 RL / RLHF / RLAIF,本质上是: prompt → model output → reward model 打分 → 更新模型 但如果 J-space 走通,训练范式可能变成: prompt → model internal J-space + output → critic 打分 → 更新模型 这不是训练模型最后说什么。 这是训练模型在关键时刻“应该意识到什么”。 以前我们训练模型的嘴。 现在可能开始训练模型的内心独白。 这才是 Anthropic 这篇最值钱的地方。 它不只是 interpretability,而是可能影响 RL、对齐、长期记忆、continuous learning、fine-tuning 本身 甚至更多这两三年我们习以为常的操作。 知识库是外挂,微调是重训。 但 J-space 如果成熟,可能会出现第三种东西:直接塑造模型在某类场景下会激活什么概念、记住什么经验、调用什么原则。 而值得注意的是这一篇工作似乎诞生于 Sonnet4.5 时代,Anthropic 比 OpenAI 更让人震撼。 我甚至能想到前段时间大量 Researcher 批量加入 Anthropic 的场景: """ X: "我不喜欢你们,你们是一家非常喜欢封号的公司" Claude: “要不你看看我们半年前研究的这些工作再说,但这些论文都接近 close 了,你进来肯定挂不上这些名了,但你可以自己探索新方向” X: "我什么时候可以入职!" """ 早期 OpenAI 迷人的地方,是 GPT-2、GPT-3、CLIP、Whisper 那种朴素但强大的信念: 用数据、规模和统一范式,打破之前学术界“架构优先”的惯性。 那时候的 OpenAI 很像一个有明确科学直觉的组织。它知道自己相信什么,也知道自己要把世界往哪个方向推。 但现在的 OpenAI 越来越像产品和算力公司,强是强,却越来越难感受到一套属于自己的科学理念。 Anthropic 反而还在追问更底层的问题,J-space 不是证明模型有灵魂,它想证明模型的“内心独白”可能可以做成 API。 一开始我还以为 J-space 只是随手起的名字,后来仔细看才发现这个 J 是 Jacobian。 这就太浪漫了。 Jacobian 把多元复杂函数在局部近似成可操作的线性函数;J-space 则像是在把模型内部高维、复杂、混沌的 latent space,投影成一组可以读取、干预、训练的方向。 这种命名的美感,让我想到 SpaceX。 其实我从高一开始关注到 Musk 的,那会我每周都会买很多杂志,在其中一期看到了他完整的创业记录,只是近几年所有人都认识他了,所以也不怎么提了。 当时令我印象深刻的倒不是今天熟悉的星舰,而是 2008 年 Falcon 1 的第四次发射。前三次全部失败,第四次几乎凑出了最后所有的钱做发射,包括 Tesla 那一次 Falcon 1 入轨,SpaceX 才活了下来。 后来他们把海上火箭回收船命名为 Of Course I Still Love You。这名字出自科幻小说,不是冷冰冰的工程代号,而像一句情书,去接住一枚从天上返回的火箭。 所以迷人的地方是极端硬核的工程、生死边缘的赌局,最后被一种近乎浪漫的命名接住。 科学、工程和浪漫,在这里突然接上了。 Author List 中 Wes Gurnee @wesg52 和 Jack Lindsey @Jack_W_Lindsey 构思了整套方法,以及语言表达与意识访问之间的联系,伟大无需多言。 有两位华人 Rowan Wang 和 Runjin Chen 参与了 Reflection 训练部分
显示更多
0
22
199
24
转发到社区