OpenAI发布o3-mini:ARC-AGI达87.5%,首个支持函数调用的推理模型
OpenAI发布o3-mini:ARC-AGI达87.5%,首个支持函数调用的推理模型
2025年1月31日OpenAI发布o3-mini推理模型,ARC-AGI基准87.5%远超前代,AIME 2025达88.9%,首个支持函数调用和结构化输出的o系列模型,首次向免费用户开放。
2025 年 1 月 31 日,OpenAI 正式发布 o3-mini 推理模型,这是 o 系列的最新成员,在推理能力上实现重大突破,同时首次向 ChatGPT 免费用户开放。
推理性能全面突破
ARC-AGI 基准
- o3-mini 得分 87.5%
- 前代 GPT-4o 仅约 5%
- 实现近 18 倍提升
- 接近人类水平
AIME 2025(美国数学竞赛)
- 得分 88.9%
- 解决高难度数学问题
- 超越多数闭源模型
FrontierMath(前沿数学)
- 得分 25.2%
- 前代模型不足 2%
- 实现十余倍提升
- 解决前沿数学研究问题
三大首创
首个支持函数调用的 o 系列模型
- 之前 o1、o3 不支持函数调用
- o3-mini 首次在推理模型中集成 function calling
- 可调用外部工具和 API
- 拓展了推理模型的应用场景
首个支持结构化输出
- 可输出 JSON 等结构化格式
- 便于开发者集成
- 提升企业应用可用性
首次向免费用户开放
- 之前推理模型仅限付费用户
- o3-mini 首次向 ChatGPT 免费用户开放
- 降低推理模型使用门槛
- 推动推理能力普及
推理效率优化
- 相比 o3 完整版,mini 版本推理成本大幅降低
- 响应速度更快
- 保留核心推理能力
- 适合大规模部署
三档推理强度
- low:快速响应,低成本
- medium:平衡模式
- high:深度推理,最高质量
- 开发者可根据场景灵活选择
应用场景
- 复杂数学问题求解
- 科学推理与分析
- 代码生成与调试
- 多步骤任务规划
- 工具调用与智能体
行业意义
o3-mini 的发布标志着推理模型从「高端专属」走向「普惠通用」:
- 推理能力不再是付费专属
- 函数调用拓展了推理模型边界
- 结构化输出提升企业可用性
- 为后续 o 系列发展奠定基础