Anthropic 发行 Claude Opus 4.7,而 Mythos 仍处于封锁状态。

Anthropic 于周四发布了 Claude Opus 4.7,这是其迄今为止功能最强大的商业 AI 模型——并在发布会上多次提醒大家,他们还有一个更好的模型被锁在库中。
Anthropic 发布了其旗舰商业 AI 模型的最新版本Claude Opus 4.7,进一步扩大了其在智能体编码方面对 OpenAI 和 Google 的领先优势,同时悄然划清了该公司将向公众出售的产品与不会出售的产品之间的界限。
新模型的目标用户群体明确是开发者。Anthropic 表示,Opus 4.7 在高级软件工程方面相比 Opus 4.6 有了“显著改进”,用户反馈称,他们现在可以放心地将最棘手的编码工作(以前需要密切人工监督的任务)交给 Opus 处理。Opus 4.7 能更严谨地处理长时间运行的任务,更严格地执行指令,并在反馈结果之前设计出验证自身输出的方法。
Opus 4.6 的定价保持不变,输入代币每百万个 5 美元,输出代币每百万个 25 美元。该模型已在 Anthropic 的API、Amazon Bedrock、Google Cloud 的 Vertex AI 和 Microsoft Foundry 上线,并已面向 GitHub Copilot的 Pro+、Business 和 Enterprise 用户推出。
领先优势显著,但差距很小
Opus 4.7 以微弱优势重夺公开可用前沿模型榜首,在涵盖智能体编码、规模化工具使用、智能体计算机使用和金融分析的关键基准测试中,其得分超过了OpenAI 的 GPT-5.4和 Google 的 Gemini 3.1 Pro。VentureBeat 的 Carl Franzen 指出,在直接可比的基准测试中,Opus 4.7 仅以 7 比 4 的优势领先于 GPT-5.4,这表明各大实验室之间的差距正在迅速缩小。

当前人工智能模型基准,来源:Anthropic
该模型在SWE-bench Pro和SWE-bench Verified这两项衡量复杂工程工作性能的权威测试中均名列榜首。除了基准测试性能之外,Originality.ai的一项人工智能研究发现,Claude Opus 4.7仍然高度可识别为人工智能生成的代码,这为该模型在实际应用中的输出提供了独立的评估。Anthropic引用的早期测试人员报告称,他们在内部评估中获得了显著提升。
视觉效果是另一项重大升级。Opus 4.7 能够处理长边高达 2,576 像素的图像,分辨率是之前 Claude 型号的三倍以上。这一改进为依赖精细视觉细节的应用场景打开了大门,例如计算机代理解析密集屏幕截图以及从复杂的技术图纸中提取结构化数据。
人类学的弱点显而易见
版本说明异常坦诚地指出了 Opus 4.7 的不足之处。该模型并非在所有类别中都表现出色:GPT-5.4 在智能搜索、多语言问答以及一些基于终端的编码任务中仍然领先。此外,Opus 4.7 在网络安全漏洞复现方面的得分也略低于 Opus 4.6,分别为 73.1% 和 73.8%,Anthropic 将这一下降归因于其新增的自动化网络安全防护措施。
迁移过程也并非一帆风顺。该模型使用了一个更新的分词器,可以将相同的输入映射到 Opus 4.6 的 1.0 到 1.35 倍数量的词元,并且在高努力程度下会进行更深入的思考,在智能体工作流程的后续轮次中生成更多输出词元。开发者可能需要重新调整为早期模型编写的提示,因为 Opus 4.7 会严格按照指令执行,而其前代模型则对指令进行较为宽松的解释。
Anthropic 自身的评估认为该模型“总体上符合标准且值得信赖,但其行为并非完全理想”。在诚实度和抵御“立即注射”攻击等指标上,Opus 4.7 比 Opus 4.6 有所改进。但在其他方面——例如倾向于提供过于详细的管制药物减害建议——则略逊一筹。
神话阴影
周四发布的版本背后更深层次的含义在于Anthropic公司并未公开发售的产品。该公司反复强调Opus 4.7“功能不如我们最强大的型号Claude Mythos Preview”——这款前沿系统是本月早些时候在“玻璃翼计划” (Project Glasswing)下发布的,仅限约40家经过审核的企业和政府合作伙伴使用。
正如BNC上周报道的那样,Anthropic公司认为Mythos系统能够自主发现并利用零日软件漏洞,其规模远超人类研究人员和所有现有的自动化工具。该公司将其限制在一个由苹果、谷歌、微软、亚马逊网络服务(AWS)、CrowdStrike和摩根大通组成的联盟内。相比之下,Opus 4.7经过专门训练,网络安全能力有所降低,并配备了安全防护措施,能够自动检测并阻止被标记为违禁或高风险网络安全用例的请求。
Gizmodo 的 Jake Peterson 直言不讳地指出,Opus 4.7 的发布实际上也是 Anthropic 公司拒绝出售其系统的营销手段。合法的安全研究人员可以通过一项新的网络验证计划申请更广泛的访问权限,Anthropic 公司将该计划定位为漏洞研究、渗透测试和红队演练的受控入口。
双轨策略的重要性远不止于人工智能行业。在 Opus 4.7 发布时,比特币的交易价格接近 74,500 美元,与 4 月初 Mythos 漏洞披露以来的价格区间基本持平。以太坊、Solana 和其他区块链上锁定在智能合约中的约 2000 亿美元资金,受到基于摩擦的防御机制(审计、时间锁、多重签名治理)的保护。但 Anthropic 公司曾警告称,这些机制在面对模型辅助攻击者时会变得“相当脆弱”。
开发者如今能获得什么
与 Opus 4.7 一同发布的还有 Anthropic 推出的全新“xhigh”难度级别,该级别介于 high 和 max 之间,使开发者能够更精细地控制推理深度和延迟之间的权衡。任务预算功能在 Claude 平台上开启了公开测试,允许开发者限制自主代理的代币支出,以防止长时间运行的任务产生过高的费用。在 Claude Code 中,新增了一项功能。 /ultrareview slash 命令会运行一个专门的审查会话,标记出细心的高级审查员会发现的错误和设计问题,而且该公司的“自动模式”(允许 Claude 无需不断的权限提示即可执行操作)已扩展到 Max 计划订阅者。
对于正在考虑升级的开发者,Anthropic 建议先从高难度或超高难度的编码和代理用例入手,在真实流量上测试令牌使用情况,并在将模型部署到生产环境之前参考迁移指南。关键在于,前沿功能以两个月为周期持续推出,价格却保持不变,而 Anthropic 认为真正具有变革意义的版本仍然秘而不宣。








