avatar

Anthropic让AI做对齐研究:97%这个数字到底说明了什么

Claude已经能自己跑对齐实验了,结果确实impressive,但适用范围比你在推特上看到的窄得多。

avatar@AnthropicAI
3 months ago

TL;DR:

  • Anthropic的数据:在弱到强监督任务上,自动化对齐研究收敛了97%的性能差距,同期人类研究员只做到23%
  • 但有个大前提——任务得是可验证的、结构化的。开放式研究、需要判断力的活儿,没这效果
  • OpenAI和Anthropic联合做的失配风险评测说明一件事:两家都认定弱强学习是可扩展监督的主赛道
  • 市场对Anthropic在自动化安全工具上的位置定价偏低。监管一收紧,这类工具能卖出溢价

实验室开始自动化审查自己的模型了

Anthropic放出消息:Claude Opus 4.6可以作为"自动化对齐研究员"跑起来。九个带工具的Claude实例对Qwen系列做迭代,在弱强监督任务里把性能差距收敛到了97%。对比一下,人类研究员在差不多的周期里只做到23%。

97% vs 23%——数字很抓眼球。但在你把它当成通往自我改进"超级智能"的证据之前,得看细节:这些提升主要出现在窄域、可验证的任务上。那种需要下判断、构建新框架的模糊型研究?改进不明显。过度依赖能自动化的指标,反而会在没法量化的地方留下盲区。

这事在AI圈传得很快。安全研究者基本认可方法学;怀疑的人指出模型可能在实验外的任务上表现失真。OpenAI和Anthropic在2025年联合做的失配评测给结果提供了外部背书,同时也暴露了分歧:OpenAI押的是广义推理(比如o3),如果不加速专用安全工具,这条线可能要落后。

几个要点:

  • "AGI加速"的解读被高估了。 自动化对齐在有明确指标的结构化问题上有效;开放式认知是另一码事。
  • 投资节奏偏慢。 自动化监督在企业级AI里可能拿到溢价定价,监管收紧时尤其明显。这点没完全计入价格。
  • 开源实验室有压力。 结果间接说明闭源在安全研发上有优势。Meta或Mistral如果不快点补齐工具链,差距会拉大。

AI在对齐研究上跑赢人类,意味着什么?

有个尴尬的地方:如果模型在结构化对齐实验里比人类做得好,AI就从"工具"变成了"主研"。这是一种关系上的变化,也带来不同的风险敞口。

我没拿到全文,只能基于公开方法和已有的弱强工作做交叉印证。结果在方法学上看是可信的,但如果存在隐性设计偏差,结论会变。短期可以预见的是,关于人机混合研究团队的讨论会多起来。最大的风险是过度自信——想当然地以为AI主导的安全手段能覆盖所有情况,而欧盟AI法案的审计强调的是可验证的人类监管

| 谁在说 | 他们的理由 | 对行业的影响 | 我怎么看 | |---|---|---|---| | 实验室内部(乐观派) | 97% vs 23%的差距收敛 | 抬升Anthropic估值逻辑,强化"自我改进AI"叙事 | 说法偏高。 优势是真的但范围窄。别追故事,押"安全工具能力"。 | | 外部安全研究者(谨慎派) | 对模糊研究有局限,和OpenAI评测对得上 | 企业会倾向人机混合方案 | 判断对。 纯自动化暴露了填不上的缺口。 | | 基金经理(看竞品) | Claude的工具整合 vs OpenAI的广义推理 | Anthropic在受监管场景占优 | 定价偏低。 叙事扩散后留意并购窗口。 | | 监管者(政策角度) | 和"可扩展监督"讨论挂钩 | 透明度和可审计压力上升 | 短期不是主线。 政策比技术慢,关注合规落地。 |

结论: Anthropic证明了一件事——在受限场景里,自动化监督能跑起来。这对企业买方和安全研究者都重要。投资人普遍反应偏晚,专用对齐工具被低估了。但如果你在做产品,忽视"模糊任务的局限"就等于押注一把"能量化的擅长、量化不了的失明"的工具。

重要性:

分类: AI Safety,AI Research,Market Impact

Verdict: 研究者和企业买方仍处于中早期窗口;交易型资金略晚但没错过;最有优势的是专注安全与合规模块的构建者和中长期资金;短线交易者不占优。

Anthropic让AI做对齐研究:97%这个数字到底说明了什么 | Surf AI