月访问量
0
累计浏览
42
用户评分
4.6
收录时间
2026-08
产品介绍
产品介绍
DeepSeek-V4-Flash-Vision-Exp 是深度求索(DeepSeek)于2026年8月21日正式上线的实验性多模态视觉模型,也是 DeepSeek V4 系列首款接入视觉能力的模型。该模型拥有2840亿总参数,每次推理仅激活130亿参数(激活率约4.6%),在保持 DeepSeek-V4-Flash 完整文本推理能力的基础上,新增了图片输入理解功能,标志着 DeepSeek 正式补齐全模态能力版图。
核心能力
- 视觉理解:支持图片输入,可识别图像内容、图表、文档截图等
- 文本能力对齐:纯文本能力(Agent、推理、世界知识)与 DeepSeek-V4-Flash 完全持平
- 多模态Agent:显著提升多模态 AI Agent 任务表现,支持看图操作、屏幕理解等场景
- 1M上下文窗口:继承 V4 系列的百万级超长上下文能力
- 峰谷定价:采用与 V4-Flash 相同的峰谷分时定价策略,性价比极高
基准测试结果(2026年8月24日更新)
- 文本测试:七项文本基准测试中六项超越上一代 V4-Flash
- 视觉测试:两项视觉理解基准测试得分高出上代10分以上
- 对比Claude:综合表现小幅领先 Claude Opus 4.8
- Harness框架:同步升级至 0.1.1-rc.1,打通图文混合输入,开发者可直接扔一张截图加一句需求让AI看图办事
- 成本压缩:官方新压缩方法将百万输入tokens成本压低73%
技术规格
| 参数 | 规格 |
|---|---|
| 模型版本 | DeepSeek-V4-Flash-Vision-Exp |
| 总参数量 | 284B(2840亿) |
| 激活参数 | 13B(130亿) |
| 上下文长度 | 1M tokens |
| 最大输出 | 384K tokens |
| 输入模态 | 文本 + 图片 |
| 并发限制 | 2500 |
| API格式 | OpenAI兼容 / Anthropic兼容 |
定价说明
- 缓存命中输入:空闲0.05元/百万tokens,高峰0.10元/百万tokens
- 缓存未命中输入:空闲1.5元/百万tokens,高峰3.0元/百万tokens
- 输出:空闲4.5元/百万tokens,高峰9.0元/百万tokens
- 高峰时段:北京时间 9:00-12:00、14:00-18:00
- 图片按尺寸换算为token计费
API调用示例
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash-vision-exp",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "请描述这张图片的内容"},
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,..."}}
]
}]
)
print(response.choices[0].message.content)
使用场景
- AI Agent视觉操作(看屏幕、点按钮、读界面)
- 文档/图表/截图智能理解
- 多模态内容分析
- 视觉问答与推理
- 网页和应用界面自动化
注意事项
- 当前为实验性质版本(Exp),官方建议用于测试和探索
- FIM补全暂不支持
- 图片token换算规则请参考官方文档
- 技术报告尚未公开,真实水平需等第三方跑分验证
- 通过 DeepSeek API 平台调用,设置 model='deepseek-v4-flash-vision-exp'