OpenAI发布o3-mini:ARC-AGI达87.5%,首个支持函数调用的推理模型

正飞GEO 2026年07月31日 03:38 4 阅读 来源:OpenAI
OpenAI发布o3-mini:ARC-AGI达87.5%,首个支持函数调用的推理模型 OpenAI发布o3-mini:ARC-AGI达87.5%,首个支持函数调用的推理模型
2025年1月31日OpenAI发布o3-mini推理模型,ARC-AGI基准87.5%远超前代,AIME 2025达88.9%,首个支持函数调用和结构化输出的o系列模型,首次向免费用户开放。

2025 年 1 月 31 日,OpenAI 正式发布 o3-mini 推理模型,这是 o 系列的最新成员,在推理能力上实现重大突破,同时首次向 ChatGPT 免费用户开放。

推理性能全面突破

ARC-AGI 基准

  • o3-mini 得分 87.5%
  • 前代 GPT-4o 仅约 5%
  • 实现近 18 倍提升
  • 接近人类水平

AIME 2025(美国数学竞赛)

  • 得分 88.9%
  • 解决高难度数学问题
  • 超越多数闭源模型

FrontierMath(前沿数学)

  • 得分 25.2%
  • 前代模型不足 2%
  • 实现十余倍提升
  • 解决前沿数学研究问题

三大首创

首个支持函数调用的 o 系列模型

  • 之前 o1、o3 不支持函数调用
  • o3-mini 首次在推理模型中集成 function calling
  • 可调用外部工具和 API
  • 拓展了推理模型的应用场景

首个支持结构化输出

  • 可输出 JSON 等结构化格式
  • 便于开发者集成
  • 提升企业应用可用性

首次向免费用户开放

  • 之前推理模型仅限付费用户
  • o3-mini 首次向 ChatGPT 免费用户开放
  • 降低推理模型使用门槛
  • 推动推理能力普及

推理效率优化

  • 相比 o3 完整版,mini 版本推理成本大幅降低
  • 响应速度更快
  • 保留核心推理能力
  • 适合大规模部署

三档推理强度

  • low:快速响应,低成本
  • medium:平衡模式
  • high:深度推理,最高质量
  • 开发者可根据场景灵活选择

应用场景

  1. 复杂数学问题求解
  2. 科学推理与分析
  3. 代码生成与调试
  4. 多步骤任务规划
  5. 工具调用与智能体

行业意义

o3-mini 的发布标志着推理模型从「高端专属」走向「普惠通用」:

  • 推理能力不再是付费专属
  • 函数调用拓展了推理模型边界
  • 结构化输出提升企业可用性
  • 为后续 o 系列发展奠定基础
分享到: