Meta深夜开源Llama 4:首用MoE架构,千万token上下文刷新开源纪录
Meta深夜开源Llama 4:首用MoE架构,千万token上下文刷新开源纪录
2025年4月6日Meta发布Llama 4系列,首次采用MoE架构,Scout提供1000万token上下文窗口创行业纪录,Maverick在LMArena以1417分超越DeepSeek登顶开源第一。
2025 年 4 月 6 日,Meta AI 深夜发布 Llama 4 全系列开源大模型,一次性推出 Scout 和 Maverick 两款 MoE 架构模型,同时预告旗舰版 Behemoth。这是 Llama 家族首次采用混合专家(MoE)架构,标志着开源大模型进入新纪元。
三大模型矩阵
Llama 4 Scout(普通版)
- 总参数 109B,激活参数 17B,16 个专家
- 1000 万 token 上下文窗口,行业最长
- 可在单个 NVIDIA H100 GPU 上运行
- 同类最佳多模态模型,超越 Gemma 3、Gemini 2.0 Flash-Lite
Llama 4 Maverick(大杯)
- 总参数 400B,激活参数 17B,128 个专家
- 1000 万 token 上下文窗口
- 可在单个 H100 DGX 主机上运行
- 超越 GPT-4o 和 Gemini 2.0 Flash
- 以一半参数量实现与 DeepSeek-V3 相当的代码能力
- LMArena ELO 得分 1417,总排名第二
Llama 4 Behemoth(超大杯)
- 总参数约 2 万亿,激活参数 288B
- 16 个专家,仍在训练中
- 多项 STEM 基准超越 GPT-4.5、Claude 3.7 Sonnet、Gemini 2.0 Pro
- 作为教师模型用于知识蒸馏训练 Scout 和 Maverick
核心技术突破
原生多模态早期融合
Llama 4 采用革命性的早期融合(Early Fusion)架构:
- 文本和视觉输入共享同一组 Transformer 层
- 视觉编码器与语言模型深度融合,而非简单拼接
- 支持任意比例的文本和视觉混合输入
- 可同时处理最多 100 张图像和长文本
- 支持最高 4096x4096 分辨率图像输入
- 支持最长 5 分钟视频输入
1000 万 token 上下文
Llama 4 Scout 拥有行业最长的 1000 万 token 上下文窗口,相当于 750 万单词或 15000 页文本:
- 可一次性输入整个中型代码库(约 10 万行代码)
- 处理完整法律合同、学术论文和书籍
- 同时分析数百张图像和文档
- Needle-in-a-Haystack 测试 800 万 token 范围内检索准确率 95%+
得益于 Meta 自研的 iRoPE(交错旋转位置编码)技术和推理时动态注意力缩放机制。
MoE 架构高效推理
以 Maverick 为例,采用交替的密集层和 MoE 层:
- 128 个路由专家 + 1 个共享专家
- 每个 token 发送到共享专家 + 128 个路由专家中的一个
- 仅激活 17B 参数,降低服务成本和延迟
性能基准
| 基准 | Maverick 得分 | 对比 |
|---|---|---|
| MMMU(复杂图像理解) | 73.4 | 高于其他模型 |
| MathVista(视觉数学) | 73.7 | 超越 Gemini 2.0(73.1)和 GPT-4o(63.8) |
| ChartQA(图像理解) | 90.0 | 领先 |
| MMLU Pro | 80.5 | 领先 |
| DocVQA | 94.4 | 领先 |
| LiveCodeBench | 43.4 | 优异 |
开源与生态
- Apache 2.0 完全开源协议
- 允许个人与企业免费商用、二次开发
- 支持 12 种语言:阿拉伯语、英语、法语、德语、印地语等
- 预训练覆盖 200 种语言
- 截至 2026 年 5 月,累计下载量突破 2.3 亿次
Meta AI 负责人 Yann LeCun 表示:「Llama 4 证明了开源模型不仅能在文本能力上与闭源模型竞争,更能在多模态领域引领行业发展。」