Meta深夜开源Llama 4:首用MoE架构,千万token上下文刷新开源纪录

正飞GEO 2026年07月31日 03:38 6 阅读 来源:Meta
Meta深夜开源Llama 4:首用MoE架构,千万token上下文刷新开源纪录 Meta深夜开源Llama 4:首用MoE架构,千万token上下文刷新开源纪录
2025年4月6日Meta发布Llama 4系列,首次采用MoE架构,Scout提供1000万token上下文窗口创行业纪录,Maverick在LMArena以1417分超越DeepSeek登顶开源第一。

2025 年 4 月 6 日,Meta AI 深夜发布 Llama 4 全系列开源大模型,一次性推出 Scout 和 Maverick 两款 MoE 架构模型,同时预告旗舰版 Behemoth。这是 Llama 家族首次采用混合专家(MoE)架构,标志着开源大模型进入新纪元。

三大模型矩阵

Llama 4 Scout(普通版)

  • 总参数 109B,激活参数 17B,16 个专家
  • 1000 万 token 上下文窗口,行业最长
  • 可在单个 NVIDIA H100 GPU 上运行
  • 同类最佳多模态模型,超越 Gemma 3、Gemini 2.0 Flash-Lite

Llama 4 Maverick(大杯)

  • 总参数 400B,激活参数 17B,128 个专家
  • 1000 万 token 上下文窗口
  • 可在单个 H100 DGX 主机上运行
  • 超越 GPT-4o 和 Gemini 2.0 Flash
  • 以一半参数量实现与 DeepSeek-V3 相当的代码能力
  • LMArena ELO 得分 1417,总排名第二

Llama 4 Behemoth(超大杯)

  • 总参数约 2 万亿,激活参数 288B
  • 16 个专家,仍在训练中
  • 多项 STEM 基准超越 GPT-4.5、Claude 3.7 Sonnet、Gemini 2.0 Pro
  • 作为教师模型用于知识蒸馏训练 Scout 和 Maverick

核心技术突破

原生多模态早期融合

Llama 4 采用革命性的早期融合(Early Fusion)架构:

  • 文本和视觉输入共享同一组 Transformer 层
  • 视觉编码器与语言模型深度融合,而非简单拼接
  • 支持任意比例的文本和视觉混合输入
  • 可同时处理最多 100 张图像和长文本
  • 支持最高 4096x4096 分辨率图像输入
  • 支持最长 5 分钟视频输入

1000 万 token 上下文

Llama 4 Scout 拥有行业最长的 1000 万 token 上下文窗口,相当于 750 万单词或 15000 页文本:

  • 可一次性输入整个中型代码库(约 10 万行代码)
  • 处理完整法律合同、学术论文和书籍
  • 同时分析数百张图像和文档
  • Needle-in-a-Haystack 测试 800 万 token 范围内检索准确率 95%+

得益于 Meta 自研的 iRoPE(交错旋转位置编码)技术和推理时动态注意力缩放机制。

MoE 架构高效推理

以 Maverick 为例,采用交替的密集层和 MoE 层:

  • 128 个路由专家 + 1 个共享专家
  • 每个 token 发送到共享专家 + 128 个路由专家中的一个
  • 仅激活 17B 参数,降低服务成本和延迟

性能基准

基准 Maverick 得分 对比
MMMU(复杂图像理解) 73.4 高于其他模型
MathVista(视觉数学) 73.7 超越 Gemini 2.0(73.1)和 GPT-4o(63.8)
ChartQA(图像理解) 90.0 领先
MMLU Pro 80.5 领先
DocVQA 94.4 领先
LiveCodeBench 43.4 优异

开源与生态

  • Apache 2.0 完全开源协议
  • 允许个人与企业免费商用、二次开发
  • 支持 12 种语言:阿拉伯语、英语、法语、德语、印地语等
  • 预训练覆盖 200 种语言
  • 截至 2026 年 5 月,累计下载量突破 2.3 亿次

Meta AI 负责人 Yann LeCun 表示:「Llama 4 证明了开源模型不仅能在文本能力上与闭源模型竞争,更能在多模态领域引领行业发展。」

分享到: