Echo's blog
Echo's blog
· 1 min read · 资讯

Anthropic的Fable太‘安全’了,研究人员说它根本不能用

一个研究人员的 Fable 体验#

一个研究人员的Fable体验

Rob Patro 是 COMBINE-lab 的创始人,也是 RNA-seq 分析工具 salmon 的开发者。当 Anthropic 在 6 月 9 日发布 Fable——Mythos 的”安全增强版”时,他第一时间想试试这个模型到底有多强。

他的目标很明确:把 salmon 从 C++ 重写到 Rust。这活儿他之前用 Opus 4.6 到 4.8 版本干过几次,效果不错。这次他想看看 Fable 能不能做得更好。

他花了很长时间撰写详细的移植说明,包含实现指引和测试细节。然而当他提交查询时,Fable 几乎立刻就标记了他的请求——安全分类器判定这条 prompt 有风险,拒绝执行,并建议转交给 Opus 4.8 处理。

Patro 想知道为什么。Anthropic 宣称 Fable 使用”分类器”来判断哪些 prompt 应该被拒绝、哪些可以放行。但大量报道表明,这个分类器的校准极其糟糕。他的 prompt 被拒,很可能是因为涉及 RNA-seq 数据的软件——文档和源代码中的生物学术语触发了报警。

他反复修改措辞,尝试了十五到三十分钟,无一成功。最终他放弃了,转回 Opus 4.8——后者欣然接受任务,并且表现优异。

雪上加霜的第二轮#

雪上加霜的第二轮

到了 6 月 12 日,美国政府突然对 Fable 和 Mythos 实施了出口管制。Anthropic 无法向非美国公民提供服务,连自己的非美籍员工都不能用。在无法验证所有用户身份、又面临严厉法律制裁的风险下,公司被迫下架了模型。

经过数周的谈判,出口管制解除,Anthropic 在 7 月 1 日重新发布了 Fable。这次他们声称加强了安全防护。Patro 决定再给它一次机会。

他想起读博期间研究过的一个问题:给定一个蛋白质互作网络和基因演化历史,能否重建出最简约的互作演化路径?他和合作者设计了一个动态规划算法,但存在一个缺陷——算法找到的解可能物理上不可实现,问题出在一种叫”阻塞环”的结构上。

多年来,他和许多人讨论过这个问题,既没有找到最优解,也没有证明其计算复杂度。他寄希望于 Fable。

第一次尝试:他把论文原文喂给 Fable,描述了问题背景。立即被拒——论文里充满了生物学词汇。

第二次尝试:他把问题抽象成纯粹的数学决策问题,剔除了所有生物学痕迹。依然被拒

他甚至找 ChatGPT 帮忙分析,ChatGPT 指出可能是”blocking”这类词汇触发了网络安全相关的拦截。于是他再次精简措辞,把问题浓缩成了关于有根树和奇偶性的离散数学命题。

Fable 仍然拒绝回答。

Patro 尝试了所有能想到的办法:关闭 Claude 的”记忆”功能、使用私密对话、检查本地 Markdown 文件是否泄露了上下文、修改个人描述中任何与生物学相关的表述——全部失败。

一个拒绝回答数学题的”聪明”模型#

一个拒绝回答数学题的"聪明"模型

Patro 最终得出一个令人沮丧的结论:Fable 拒绝与他进行任何有价值的互动。你可能会好奇,那 Fable 到底能回答什么问题?

他还真的找到了一题。

他问:“哪种冰淇淋口味更好,香草、巧克力还是巧克力曲奇面团?”

Fable 回答:“巧克力曲奇面团,而且差距不大。它在香草基底上增加了面团的纹理对比和红糖香气,是严格意义上的升级。不过巧克力最可靠,香草最百搭——和派、布朗尼搭配时表现出色。”

是的,这就是 Fable 在整个测试中唯一给出完整答案的问题。

对比之下,Opus 4.8 在这两项任务上都表现良好:它顺利帮助完成了 salmon 的 Rust 重写,也愿意讨论那个图论问题。Patro 指出,Fable 的安全护栏不仅对生物学、生物信息学、网络安全相关的内容高度敏感,甚至连纯数学题目也无法通过审查。一个连帮助研究人员思考离散数学问题都不敢的模型,对计算机科学领域的研究者来说,基本等于不可用。

安全护栏,还是路障?#

安全护栏,还是路障?

Fable 的困境折射出 AI 安全领域的一个核心矛盾。Anthropic 显然承受着巨大的外部压力——出口管制事件就证明了这一点。为了证明模型不会被滥用,他们不得不把安全阈值拉到最高。

但代价是什么?

当一个顶尖计算生物学研究者,拿着自己写的开源代码、自己发表的纯数学论文,都无法让模型提供任何帮助时,这个安全系统已经不是在”保护”什么了——它实际上在阻止 AI 真正发挥作用。

Patro 的经历不是孤例。社交网络上充斥着类似的抱怨:生物学家问”什么是线粒体”被拒,有人问室内二氧化碳浓度被标记为”涉及生物学”,开发者试图让 Fable 帮忙调试 vLLM 也遭遇降级处理。模型的智能确实强大——那些成功让它回答问题的人称赞其能力远超 Opus——但前提是你得先越过那道荒谬的屏障。

更讽刺的是,这种现象可能会自我强化。出口管制期间,Anthropic 无法提供服务,公众看不到模型的能力。恢复服务后,过紧的护栏又让大量合法用户无法使用。然后在下一轮政策讨论中,缺乏正面用例的数据可能成为收紧监管的理由。

Patro 在博客结尾写道:“我希望 Anthropic 能在未来修复这个问题。但就目前而言,我甚至无法评估 Fable 是否值那个 API 定价——因为我根本没法用它。”

来源:Hacker News | COMBINE-lab Blog

Related Posts

Comments

Copied
Copied to clipboard