Ling-3.0-flash

Ling-3.0-flash

模型算力 开源免费/API按量付费(限时2.5折) 中国 #蚂蚁#百灵#开源#MoE#混合推理#长上下文#国产模型

蚂蚁集团百灵开源新一代原生混合推理MoE模型,124B总参数/5.1B激活参数,原生256K上下文,单机可部署,推理速度突破1100 tokens/s。

月访问量
0
累计浏览
0
用户评分
4.5
收录时间
2026-08

产品介绍

产品介绍

Ling-3.0-flash 是蚂蚁集团百灵大模型团队于 2026 年 8 月 7 日正式开源的新一代原生混合推理模型,采用创新的 MoE(混合专家)架构,总参数 124B,每次推理仅激活 5.1B 参数,在保持旗舰级能力的同时实现极致推理效率。该模型原生支持 256K 上下文窗口,最高可扩展至 1M,长程任务稳定性和工具调用精确度显著提升。华为昇腾已宣布 0 Day 支持该模型。

核心功能

  • MoE 高效架构:124B 总参数 / 5.1B 激活参数,兼顾模型容量与推理成本
  • 原生 256K 上下文:支持超长文档分析,最高可扩展至 1M
  • 混合推理能力:思考/非思考模式灵活切换,工具调用精确度行业领先
  • 多量化版本:提供基础版、FP8、FP4、INT4 多种量化选择
  • 单机可部署:MXFP4 与 INT4 版本可在单台 NVIDIA DGX Spark 上端到端推理
  • 超高速推理:高性能配置下平均输出速率突破 1100 tokens/s,Artificial Analysis 榜单实测 353 tokens/s
  • 高性价比:AA 榜单加权平均调用成本约 0.04 美元(约 0.27 元人民币)/任务,进入智能水平-成本优势区域

快速接入

API 调用

from openai import OpenAI

client = OpenAI(
    api_key="your-ant-ling-key",
    base_url="https://api.ant-ling.com/v1"
)
response = client.chat.completions.create(
    model="ling-3.0-flash",
    messages=[{"role": "user", "content": "解释MoE架构相比Dense模型的优势"}]
)
print(response.choices[0].message.content)

开源下载

  • Hugging Face:https://huggingface.co/inclusionAI/Ling-3.0-flash
  • ModelScope:https://modelscope.cn/models/inclusionAI/Ling-3.0-flash

本地部署(INT4 量化版)

# 使用 vLLM 单机部署
python -m vllm.entrypoints.openai.api_server \
  --model inclusionAI/Ling-3.0-flash-int4 \
  --tensor-parallel-size 1

定价说明

  • 2026年8月7日-8月31日:Ling Studio 限时 2.5 折优惠
  • 2026年9月1日起恢复原价
  • 开源版本可免费自托管(遵循开源许可)
  • API 按 token 按量计费

典型使用场景

  • 企业级 Agent 应用开发(工具调用精度高)
  • 长文档理解与分析(256K+ 上下文)
  • 成本敏感的大规模推理部署(激活参数小,成本低)
  • 私有化部署(单机即可运行,数据不出域)
  • 国产算力适配(华为昇腾 0 Day 支持)

平台支持

通过蚂蚁 Ling Studio API、HuggingFace、ModelScope 下载访问,支持 NVIDIA GPU 和华为昇腾 NPU 双平台部署。