Claude新模型发布即被破解,27万字底牌全泄露
Anthropic 刚发布的新一代模型 Claude Fable 5.1,上线还没几个小时,就被知名黑客 Pliny the Liberator 给"扒光了"——一份超过 27.5万字 的系统提示词完整泄露,模型的"底牌"被彻底曝光。官方公布的所谓"系统提示词",在他看来不过冰山一角,只有 10%。
这份"天书"里到底藏着什么秘密?为什么一个 AI 模型要给自己立这么多规矩?今天咱们就扒一扒这份泄露的提示词,看看 Claude 的"人设"是怎么被硬生生焊死的。
一、发布即翻车:27万字提示词被完整扒出
先看成绩单,这次 Fable 5.1 确实猛。在代码工程基准 Terminal-Bench 4.0 上从前代的 42.0% 飙到 55.8%,放开护栏的 Mythos 5.1 更是冲到 60.9%。缓存读取费用直接从 1 美元砍到 0.25 美元,降幅 75%,重度 Agent 长任务最高能省 45%。
但真正炸锅的,是它发布后几小时就被破解。Pliny the Liberator 在 GitHub 上甩出一份 275,000+ 字符 的完整系统提示词,包含核心行为逻辑、记忆系统、搜索与版权规则、Artifacts 和计算机使用指南,以及全部 46 个工具 的 JSON 架构——这些官方根本没打算公开。
有意思的是,Fable 5.1 和 Mythos 5.1 其实是同一个模型、同一套权重,只是安全限制不同:Fable 面向公众开放,加了护栏;Mythos 只给审核过的网安和生命科学专家用。而这份泄露的提示词,正好把 Fable 身上的"枷锁"全抖了出来。
二、泄露的提示词里,藏着这些"铁律"
1. 别想让我画刺猬索尼克
Fable 5.1 被严禁重现任何受版权保护的歌曲、诗歌、书籍片段(1929 年前的公版作品除外)。更夸张的是视觉创作:无论你用 SVG、CSS、代码还是 HTML,绝不允许画出任何已知角色、Logo、专辑封面。系统里甚至明确写着:"不允许画刺猬索尼克,也不允许画《好饿的毛毛虫》"——哪怕你要求改变姿势、颜色或风格,也绝对不行。
2. 拒绝当"心理医生"和"化学绝命毒师"
它被明确要求:绝不能对用户的心理状态或动机做出断言,绝不能说出未经披露的诊断,还被禁止放大用户的负面情绪。在毒品话题上采取"减少伤害"策略——可以告诉你过量吸食的危险和急救方法,但绝不提供剂量、时间安排或配方,还会把你引导至援助网站。
3. 记忆系统大重构:有些事"至死不记"
最震撼的是隐私保护机制。记忆系统变成"后台自动执行",但加了严格的隐私分类边界。下面这些属于"永远不存储"的禁区:未成年人的身份信息、种姓与移民状态、犯罪记录、心理与精神推断、性史与自残倾向。即使你暴露了这些信息,系统也会在后台强制清空,避免隐私泄露。
4. 工具大爆炸:从 30 个猛增至 46 个
能力碾压前代的最大底牌,是内置工具从 7 月的 30 个暴增到 46 个。新增了 chart_display(图表)、carousel_display(轮播图)、link_preview_display(链接预览)等,还加了 read_conversation——它现在能翻阅你们过去的聊天记录提取关键信息,不再是那个"一刷新就失忆的傻白甜"。
三、44分钟,破解370年无解的历史密码
除了泄露,Fable 5.1 还干了一件封神的事:它只用了 44 分钟、消耗 17.6 万 token,在没有任何人类干预的情况下,破解了困扰密码学界近百年的经典密码 Cyphral Distich——1653 年苏格兰学者留下的 64 个数字,被列入"全球 50 大未解加密信息"。
它靠的不是暴力破解,而是"横向联想与语境推理"。它发现密码紧跟作者写的 32 篇短文之后,作者还强调"没有什么数字能比 32 更好",密码第一行和第二行都是 32 个数字……于是 AI 顿悟:钥匙根本不在外部密码本,而在这本书本身。用第 i 个数字作为单词索引找词、提取首字母,一段祈求国王查理二世复辟的诗句跃然纸上,完美契合作者的保皇党背景。随后它又顺手破解了另一个 285 个数字的大密码。
这背后最可怕的一点是:Fable 5.1 不再单纯"猜概率",它学会了像侦探一样,在浩瀚历史文本里寻找草蛇灰线,把看似不相关的线索逻辑拼接。正如有人总结的——"历史上许多难题之所以未解,是因为缺乏人类的注意力。而现在,这个瓶颈正在消失。"
四、一边"松"护栏,一边"反蒸馏"上锁
Anthropic 这次在安全上主打"一松一紧"。松,是护栏不再那么"神经质"——以前程序员拿 Claude 审自家代码动不动被当黑客拦截,现在 Fable 5.1 终于允许识别代码漏洞了,网络安全误报直降六成;但底线卡得很死:只能找漏洞,绝不许写利用漏洞的攻击代码。
紧,则是把护城河变成了"反蒸馏机制"。为了堵死以前那种多轮对话里修改上下文、趁机套取思维链的路子,Fable 5.1 干脆在 API 底层上锁:只要你提交的提示词跟生成思维块时不一致,API 要么直接报错拦截,要么把整个思维块全部抽走。目前先拿 8 月 31 日之后注册的 API 新账号开刀,但官方已放话,未来所有新模型这把锁将全员强制生效。
一边是发布即被扒光的尴尬,一边是严防死守的反蒸馏。这场"攻防战"其实才刚刚开始——OpenAI 的 Astra 也马上要登场了。AI 巨头们的底牌,恐怕还会被一张张掀开。
来源:新智元、36氪、AIBase、GitHub
发布时间:2026-09-02
评论区