Mythos 以 100,000 万美元的价格削弱了一种后量子密码

Anthropic 的 Claude Mythos Preview 在 60 小时内将一种后量子签名方案的安全性降低了一半,并改进了一种存在了 25 年的 AES 攻击。成本:每个 100,000 万美元。你的比特币安全吗?让我们拭目以待。
密码学的运作方式大致是这样的:一群非常聪明的人提出一个数学方案,然后另一群非常聪明的人花几年时间试图破解它,如果他们失败了,我们就一致同意把钱都通过这个方案来支付。就是这样。这就是机制。AES 并没有安全的证据。唯一的事实是,25 年来,世界上最顶尖的密码分析专家都尝试破解它,但大多都失败了,而我们集体决定将持续的失败视为安全的证据,公平地说,这也是我评估我家公寓楼结构工程的方式。
这种安排的经济逻辑一直有点奇怪。破解密码竟然成了一项职业。你先拿到博士学位,再做博士后,花三年时间研究一个问题,如果运气好,你或许能把别人针对一个几乎没人用的密码版本的攻击效率降低四倍。攻击手段的数量受限于密码分析员的数量,而密码分析员的数量又受限于愿意从事这项工作而不是去做其他几乎任何报酬更高的工作的人的数量。
7月28日,Anthropic公司发布了一篇博文,称其Claude Mythos Preview模型产生了两个全新的密码分析结果,每个结果都需要花费约10万美元的API积分。我想仔细想想这个数字,因为技术结果固然有趣,但这个数字才是关键所在。

结果简述如下
有两个,而且都不会损坏你使用的任何东西。
一、 HAWK 是提交给美国国家标准与技术研究院 (NIST) 后量子密码学竞赛的数字签名方案。NIST 的后量子密码学竞赛旨在寻找新的签名算法,以取代那些最终会被量子计算机超越的现有算法。HAWK 已进入第三轮候选方案。它经历了两年多的两轮专家评审,而这正是整个流程的意义所在:公开方案,接受各方挑战,最终决出胜负。
Mythos 在 HAWK 使用的特定数学格中发现了一种对称性——一种“非平凡自同构”,我在此忠实地复述该术语,并不试图对其进行解释。早期的研究已经证明,如果这种对称性存在且能够被高效地找到,HAWK 的安全性将会降低。当时没有人知道它是否真的存在。但它确实存在。该模型在大约 60 小时内就找到了它。
这样做会使 HAWK 的有效密钥长度减半。据估计,恢复一个 HAWK-256 密钥需要大约 2⁶⁴ 次运算;Anthropic 算法的计算量为 2³⁸ 次。虽然仍然是指数级的,而且仍然是 HAWK 特有的,但并不影响其他格方案。你可以通过将密钥长度加倍来解决这个问题,但这样做会抹杀 HAWK 的大部分优点,这相当于密码学上的“我们可以救活病人,但他不再是病人了”。
二、 AES-128 有十轮加密。Mythos 改进了一种针对七轮加密版本的攻击,其威胁模型假设攻击者可以加密 2¹⁰⁵ 个选定的明文,而这种数据量在我看来是“无法获取的”。Mythos 发明了一种名为“莫比乌斯桥”的技术,该技术消除了中间相遇攻击中的 2⁵⁶ 个猜测步骤,使整个攻击速度提高了 200 到 800 倍。真正的 AES 本身没有问题。密码学家正是通过减少轮数的攻击来评估完整密码的安全裕度,而 Mythos 的攻击会略微缩小安全裕度。
Anthropic公司在6月份向HAWK的作者披露了相关信息,并与NIST的公共邮件列表进行了协调,向政府和业界进行了简报,同时寄送了两篇论文和演示代码。这确实是值得称赞的做法,在说其他任何事情之前,我想先强调这一点。

模型不想做的那部分
当研究人员最初将AES作为攻击目标时,Mythos拒绝了。并非出于安全考虑,而是因为它认为这个项目很愚蠢。它写道,AES-128 r5/r6确实非常难,根本找不到任何容易破解的漏洞;它是现存研究最深入的分组密码,而这,我必须强调,才是正确的观点。一位训练有素的密码学家会这么说,我也会这么说。这是该模型通过阅读所有人类关于AES的著述所得出的结论:攻击AES是浪费三年时间却一无所获的绝佳方式。
于是,这位研究人员给它发了一封邮件,而 Anthropic 杂志发表的邮件中保留了所有的错别字:
“这些模型往往认为这个问题不可能解决,所以它们不会尝试,它们需要大量的提示。”
接下来的三天里,我们又收到了三条信息,全部都来自一位冰球教练的比赛间隙记录。我们想要找到新的攻击手段。我们需要找到值得发表的东西。我们不追求唾手可得的成果。在此期间,该模型产生了数亿个自主工作代币——最终达到了十亿——并最终抵达了莫比乌斯桥。
我觉得这事儿既滑稽又有点儿令人不安。一个能够涵盖二十五年密码分析文献的系统,其根本限制在于它吸收了我们传递的一个完全合理的信念:尝试是徒劳的。而解决办法竟然是鼓励,尽管其中夹杂着语法错误,但却是免费的。我们一直称之为“能力”的很大一部分,原来是勇气,而勇气显然是可以轻易获得的。

数量
每项成果100,000万美元,两次。这比博士后还少,比中型会议的餐饮费还低,用加密货币术语来说,这不过是A轮融资中的一个小数目。而它能换来的,却是足以成为密码学家简历上最亮眼一笔的成果。
一旦某种脑力劳动有了定价,其市场就会重组,而且重组并不会向现有企业倾斜。Anthropic 公司几乎是顺带提及,他们搭建了一个框架来自主攻击 AES 算法,然后出于好奇,又将同样的框架指向了 HAWK 算法,看看它是否能够独立地重新发现漏洞。结果证明,HAWK 可以。所以,这 100,000 万美元买的不是单一的结果,而是一台能够产生结果的机器,而且这台机器对攻击目标并不挑剔。这引出了真正重要的事情。
验证是新的瓶颈
Mythos 大约花了一周时间发现了 AES 攻击。而 Anthropico 的两名研究人员则花了大约一个月的时间和数百个小时才最终确认该攻击的正确性。
这个比例代表了整个未来。密钥发现的成本降低了,但验证的成本却没有降低。HAWK 的结果更容易让人信任,因为它采用端到端的运行方式——生成密钥,运行攻击,然后取回密钥,这样就无需信任对方。AES 的结果是一种论证,而论证需要由理解它的人来解读,这样的人可能只有几百个,而且他们很忙,也没有报酬。
人类学也指出了这一点,并且指出了整个领域的普遍情况:人类研究人员在验证机器输出时可能会遇到瓶颈。我们已经在漏洞披露中目睹了这种情况,自动化漏洞发现生成报告的速度远超维护人员的处理速度,而对于志愿者运营的项目来说,实际结果并非安全性的提升,而是邮箱爆满和人员离职。同行评审就像一个礼物经济,由一群疲惫不堪的人在晚上11点还在工作,它没有应对突发情况的能力。
好的,那你的硬币呢?
这里的内容与比特币无关。但请注意 Anthropic 在其“后续工作”部分列出的内容:针对 LEA(一种符合 ISO 标准的轻量级密码)的实用型 13 轮攻击,可在台式机上不到一小时恢复密钥;改进的 6 轮 Serpent 攻击;以及针对 Salsa20、SHA-1 和 Poseidon 的小幅提升(低于 10 倍)。
Poseidon 是许多零知识基础设施底层使用的哈希函数。性能提升不到 10 倍并非危言耸听。然而,这是语言模型首次与零知识生态系统赖以生存的基本元素同时出现,而 Anthropic 也明确表示,这些只是初步结果,他们预期未来会进一步改进。
更重要的一点是结构性的。NIST之所以要对后量子签名进行标准化,是因为ECDSA签名会被足够强大的量子计算机破解。比特币目前针对这一问题的应对方案是两项提案草案:BIP-360引入了一种抗量子输出类型;BIP-361由Jameson Lopp及其合作者于4月发布,旨在逐步淘汰旧式签名,并最终冻结尚未迁移的比特币。根据该提案,截至3月,超过三分之一的比特币仍存储在已公开公钥的地址上。BIP-361的一位合作者估计,从共识形成之日起,完成迁移大约需要七年时间,而目前尚未达成共识。
所以:目前正在遴选替代方案,而遴选过程刚刚证明,一个预算仅为100,000万美元、只需一个长周末就能完成的模式,就能轻松超越它。最终不得不采用这些方案的连锁店,其推进周期长达七年,而且无权强制任何人采取任何行动。
这一切都无需恐慌,而且“信息披露是自愿的”这句话我也不想再重复写了。Anthropic 的做法是正确的,同时也向所有人证明了这件事是可以做到的。一年前,这些模型连一个简单的密码都破解不了。而现在,其中一个模型在被告知要相信自身之后,竟然在现有文献的基础上有所改进。
无人解释的补贴
我一直都在思考这个问题。
AES之所以安全,是因为它经受了数千年的专家验证,屡次被破解。但AES只是众多算法中的一种。世界运转依赖于数百种算法。你的车钥匙、楼宇门禁卡、房屋侧面的智能电表里都包含加密算法。水处理厂的工业控制器、集装箱船上的卫星调制解调器、心脏起搏器,甚至2011年通过认证、最终会因物理损坏而被替换的支付终端里,也都包含加密算法。
几乎没有哪个方案能获得长达二十五年的对抗性关注。它们经历了设计审查、标准委员会的成立,然后二十年无人问津。这并非疏忽,而是经济因素。攻击一个鲜为人知的密码意味着密码学家要花费一年的时间研究一个既没有声望也没有发表成果的目标,所以没人去做,密码也就一直坚守着。我们一直以来都依靠着“缺乏关注”来维持全球基础设施的安全,并悄悄地将其记录为安全措施。
这种补贴源于人类注意力的稀缺性,而现在这种补贴正在被取消。Anthropic 的 LEA 测试结果正是如此:一种符合 ISO/IEC 29192-2 标准的轻量级密码,专为低功耗设备设计,此前未经充分研究,如今却在极短时间内被一个模型部分破解,所需时间仅为人类破解所需时间的几分之一。完整的 24 轮版本尚未被破解,因此该结果仅为初步发现。关键在于其类别。
而且,这一类别本身就存在着一种残酷的不对称性。几乎可以肯定的是,那些加密技术审查最少的系统,也最难修复——固件、嵌入式芯片、在轨硬件、人体内的设备、以及建筑物中那些没人愿意离线的控制器。如今,漏洞发现需要花费数天时间,成本高达六位数。而修复则需要几个采购周期,成本更高,甚至可能根本无法修复。过去,这两个环节的进展速度大致相同。但现在,情况已经截然不同了。
这里的问题其实并非在于保密性,而这正是人们容易误解的地方。密码学的主要功能是身份验证:它让银行确认是你本人,让汽车确认钥匙是否正确,让设备确认软件更新确实来自制造商。隐私泄露会导致信息泄露,身份验证失败则会让别人冒充你。如果签名方案出现问题,受损的并非机密性,而是任何系统识别通信对象的能力,而这几乎是过去三十年来所有系统赖以生存的基础假设。
客观地看待这个问题,是因为它有利有弊,而且可能更有利于解决问题。如果攻击一个密码需要花费 100,000 万美元,那么审计一个密码也需要 100,000 万美元,这样一来,公用事业公司、芯片供应商或标准制定机构现在就能负担得起在其产品中进行检查的费用——这在以前是根本不可能的,因为以前根本找不到密码学家来做这件事。Anthropic 将此视为一个最终可以研究长尾漏洞的机会,而这确实是一个机会。由实验室发现并发表论文的漏洞,肯定比那些一直未被发现,直到被不发表论文的人发现的漏洞要好得多。
但你无法选择哪一方先行动,而且这些模型并非互斥。总有人拥有类似的能力和预算,却没有打算向美国国家标准与技术研究院 (NIST) 发送邮件。人为因素模型或多或少地公开表达了这一点——它提出了这样一个问题:当一个模型发现了一个真正重要的突破点时,世界应该如何应对?它又承认自己对此并不了解。
这个故事令人欣慰的版本是,密码学一直以来都依靠对抗性审查,而审查人员的速度只是提高了。这或许没错。令人不安的版本是,我们建立在攻击成本高昂这一假设之上的文明,后来却将这一假设抛诸脑后,将其成本降至零,而现在我们才意识到它的价值所在。








