月访问量
0
累计浏览
0
用户评分
4.5
收录时间
2026-08
产品介绍
产品介绍
Ling-3.0-flash 是蚂蚁集团百灵大模型团队于 2026 年 8 月 7 日正式开源的新一代原生混合推理模型,采用创新的 MoE(混合专家)架构,总参数 124B,每次推理仅激活 5.1B 参数,在保持旗舰级能力的同时实现极致推理效率。该模型原生支持 256K 上下文窗口,最高可扩展至 1M,长程任务稳定性和工具调用精确度显著提升。华为昇腾已宣布 0 Day 支持该模型。
核心功能
- MoE 高效架构:124B 总参数 / 5.1B 激活参数,兼顾模型容量与推理成本
- 原生 256K 上下文:支持超长文档分析,最高可扩展至 1M
- 混合推理能力:思考/非思考模式灵活切换,工具调用精确度行业领先
- 多量化版本:提供基础版、FP8、FP4、INT4 多种量化选择
- 单机可部署:MXFP4 与 INT4 版本可在单台 NVIDIA DGX Spark 上端到端推理
- 超高速推理:高性能配置下平均输出速率突破 1100 tokens/s,Artificial Analysis 榜单实测 353 tokens/s
- 高性价比:AA 榜单加权平均调用成本约 0.04 美元(约 0.27 元人民币)/任务,进入智能水平-成本优势区域
快速接入
API 调用
from openai import OpenAI
client = OpenAI(
api_key="your-ant-ling-key",
base_url="https://api.ant-ling.com/v1"
)
response = client.chat.completions.create(
model="ling-3.0-flash",
messages=[{"role": "user", "content": "解释MoE架构相比Dense模型的优势"}]
)
print(response.choices[0].message.content)
开源下载
- Hugging Face:https://huggingface.co/inclusionAI/Ling-3.0-flash
- ModelScope:https://modelscope.cn/models/inclusionAI/Ling-3.0-flash
本地部署(INT4 量化版)
# 使用 vLLM 单机部署
python -m vllm.entrypoints.openai.api_server \
--model inclusionAI/Ling-3.0-flash-int4 \
--tensor-parallel-size 1
定价说明
- 2026年8月7日-8月31日:Ling Studio 限时 2.5 折优惠
- 2026年9月1日起恢复原价
- 开源版本可免费自托管(遵循开源许可)
- API 按 token 按量计费
典型使用场景
- 企业级 Agent 应用开发(工具调用精度高)
- 长文档理解与分析(256K+ 上下文)
- 成本敏感的大规模推理部署(激活参数小,成本低)
- 私有化部署(单机即可运行,数据不出域)
- 国产算力适配(华为昇腾 0 Day 支持)
平台支持
通过蚂蚁 Ling Studio API、HuggingFace、ModelScope 下载访问,支持 NVIDIA GPU 和华为昇腾 NPU 双平台部署。