Anthropic发布Claude Opus 4.1:编程能力再突破,SWE-bench达74.5%

正飞GEO 2026年07月31日 03:00 6 阅读 来源:Anthropic
Anthropic发布Claude Opus 4.1:编程能力再突破,SWE-bench达74.5% Anthropic发布Claude Opus 4.1:编程能力再突破,SWE-bench达74.5%
Anthropic于2025年8月5日发布Claude Opus 4.1,在SWE-bench Verified基准测试中取得74.5%的历史最高分,超越OpenAI o3和Google Gemini 2.5 Pro,强化AI编程市场护城河。

Anthropic 于 2025 年 8 月 5 日正式发布 Claude Opus 4.1,这是继 5 月发布 Claude 4 Opus 后仅三个月的快速迭代。新模型在编程、智能体任务和推理能力上实现显著提升,进一步巩固了 Anthropic 在 AI 编程领域的领先地位。

编程能力创历史新高

Claude Opus 4.1 在被誉为「真实世界编码试金石」的 SWE-bench Verified 基准测试中取得 74.5% 的惊人成绩,相比前代 Opus 4 的 72.5% 提升 2 个百分点,同时超越 OpenAI o3 模型(69.1%)和 Google Gemini 2.5 Pro(67.2%)。

在代理终端编程测试 Terminal-Bench 中,新模型得分 43.3%,相比 Opus 4 的 39.2% 显著提升,远超 OpenAI o3 的 30.2% 和 Gemini 2.5 Pro 的 25.3%。

真实场景反馈

GitHub 表示,Claude 4.1 Opus 在多文件代码重构等复杂任务上表现出「尤其显著的性能提升」。日本电商巨头乐天集团反馈称,新模型在大型代码库中能够精准定位并修正问题,而不会引入不必要的更改或新的错误。

被 Cognition 收购的编程应用 Windsurf 报告称,Claude Opus 4.1 在其内部初级开发者基准测试中实现了一个标准差的改进,这种性能跃升类似于从 Sonnet 3.7 到 Sonnet 4 的升级。

安全性持续强化

Claude 4.1 Opus 继续在 ASL-3(AI Safety Level 3)框架下运行,这是 Anthropic 迄今应用的最严格安全标准。在无害性测试中,新模型拒绝违反政策请求的比例从 Opus 4 的 97.27% 提高到 98.76%,在武器或毒品合成等高风险滥用场景中合作率下降 25%。

定价与可用性

Claude 4.1 Opus 保持与前代相同的定价结构:输入 tokens 每百万 15 美元,输出 tokens 每百万 75 美元,使其成为目前市场上最昂贵的 AI 模型之一。模型已向付费 Claude 用户、Claude Code 订阅者开放,并通过 API、Amazon Bedrock 和 Google Cloud Vertex AI 平台提供服务。

商业表现

Anthropic 的年化经常性收入(ARR)在短短七个月内从 10 亿美元飙升至接近 50 亿美元,AI 编程领域的 Claude Code 订阅服务年化收入已接近 4 亿美元,并在最近几周内实现翻倍增长。公司正在进行一轮由 Iconiq Capital 领投的 50 亿美元融资,估值可能达到 1700 亿美元。

分享到: