Anthropic发布Claude 3.5 Sonnet升级版:新增computer use,SWE-bench跃升至49%
Anthropic发布Claude 3.5 Sonnet升级版:新增computer use,SWE-bench跃升至49%
2024年10月22日Anthropic发布Claude 3.5 Sonnet升级版,SWE-bench Verified从33%跃升至49%,新增computer use功能可操控电脑GUI,编程能力业界领先,价格不变。
2024 年 10 月 22 日,Anthropic 发布 Claude 3.5 Sonnet 升级版,在编程能力和智能体能力上实现重大突破,同时新增革命性的 computer use 功能。
编程能力业界领先
SWE-bench Verified 飙升
- 得分从 33% 跃升至 49%
- 公开模型榜首
- 大幅领先 GPT-4o 等竞品
- 接近人类开发者水平
TAU-bench 零售场景
- 得分从 62.6% 提升至 69.2%
- 多步骤业务流程处理能力提升
- 工具调用准确率提高
computer use:操控电脑 GUI
Claude 3.5 Sonnet 升级版最大的创新是 computer use 功能(公开测试版):
- 可截屏查看电脑屏幕
- 可移动鼠标、点击按钮
- 可输入文字、执行快捷键
- 可操控图形界面软件
- 可完成多步骤 GUI 操作
应用场景:
- 自动填表
- 数据录入
- 软件操作自动化
- 跨应用数据迁移
这是首个支持操控电脑 GUI 的大模型,标志着 AI 从「对话」走向「操作」。
价格不变
- 输入:3 美元/百万 token
- 输出:15 美元/百万 token
- 与原版 Claude 3.5 Sonnet 相同
- 性能提升但价格不变
安全与责任
Anthropic 在发布 computer use 时同步强化安全措施:
- ASL-2 安全框架运行
- 拒绝恶意操作请求
- 用户确认敏感操作
- 操作日志可审计
升级亮点汇总
- 编程能力:SWE-bench 33% → 49%
- 智能体:TAU-bench 62.6% → 69.2%
- 新功能:computer use(操控电脑)
- 价格:保持不变
- 可用性:API、Claude.ai、Amazon Bedrock
行业影响
Claude 3.5 Sonnet 升级版的发布引发行业震动:
- computer use 开创了 AI 操控电脑的新范式
- 编程能力逼近人类开发者
- 为 RPA(机器人流程自动化)带来新可能
- 推动智能体从「对话」走向「执行」
Anthropic 公司背景
- 由 OpenAI 前员工创立
- 专注 AI 安全与对齐
- Claude 系列模型在编程领域领先
- 2024 年成为 OpenAI 主要竞争对手
- 获得 Google、Amazon 等巨头投资