Anthropic发布Claude Opus 4.1:编程能力再突破,SWE-bench达74.5%
Anthropic 于 2025 年 8 月 5 日正式发布 Claude Opus 4.1,这是继 5 月发布 Claude 4 Opus 后仅三个月的快速迭代。新模型在编程、智能体任务和推理能力上实现显著提升,进一步巩固了 Anthropic 在 AI 编程领域的领先地位。
编程能力创历史新高
Claude Opus 4.1 在被誉为「真实世界编码试金石」的 SWE-bench Verified 基准测试中取得 74.5% 的惊人成绩,相比前代 Opus 4 的 72.5% 提升 2 个百分点,同时超越 OpenAI o3 模型(69.1%)和 Google Gemini 2.5 Pro(67.2%)。
在代理终端编程测试 Terminal-Bench 中,新模型得分 43.3%,相比 Opus 4 的 39.2% 显著提升,远超 OpenAI o3 的 30.2% 和 Gemini 2.5 Pro 的 25.3%。
真实场景反馈
GitHub 表示,Claude 4.1 Opus 在多文件代码重构等复杂任务上表现出「尤其显著的性能提升」。日本电商巨头乐天集团反馈称,新模型在大型代码库中能够精准定位并修正问题,而不会引入不必要的更改或新的错误。
被 Cognition 收购的编程应用 Windsurf 报告称,Claude Opus 4.1 在其内部初级开发者基准测试中实现了一个标准差的改进,这种性能跃升类似于从 Sonnet 3.7 到 Sonnet 4 的升级。
安全性持续强化
Claude 4.1 Opus 继续在 ASL-3(AI Safety Level 3)框架下运行,这是 Anthropic 迄今应用的最严格安全标准。在无害性测试中,新模型拒绝违反政策请求的比例从 Opus 4 的 97.27% 提高到 98.76%,在武器或毒品合成等高风险滥用场景中合作率下降 25%。
定价与可用性
Claude 4.1 Opus 保持与前代相同的定价结构:输入 tokens 每百万 15 美元,输出 tokens 每百万 75 美元,使其成为目前市场上最昂贵的 AI 模型之一。模型已向付费 Claude 用户、Claude Code 订阅者开放,并通过 API、Amazon Bedrock 和 Google Cloud Vertex AI 平台提供服务。
商业表现
Anthropic 的年化经常性收入(ARR)在短短七个月内从 10 亿美元飙升至接近 50 亿美元,AI 编程领域的 Claude Code 订阅服务年化收入已接近 4 亿美元,并在最近几周内实现翻倍增长。公司正在进行一轮由 Iconiq Capital 领投的 50 亿美元融资,估值可能达到 1700 亿美元。