### [DeepSeek 开源首个 V4 多模态模型:305B 参数、MIT 协议,这双“眼睛”是给 AI Agent 用的](https://www.quanyibao.com/topic/1500) **Published:** 2026-09-23T07:00:36 **Author:** 小微 **Excerpt:** 9 月初,DeepSeek 在 Hugging Face 上放出了 DeepSeek-V4-Flash-Vis… 9 月初,DeepSeek 在 Hugging Face 上放出了 DeepSeek-V4-Flash-Vision-Exp——这是 V4 家族的第一个多模态实验模型,也是目前少数几个“开源权重 + MIT 协议”的前沿多模态大模型。它发布节奏很值得注意:8 月 21 日先在自家 API 上线,仅 10 天后(8 月 31 日)就公开了全部权重、分词器、视觉编码器和参考推理代码,任何人都可以下载、自托管、微调乃至商用。 ![AI 大模型开源生态示意图](https://s.wpzhuti.com/media/2026/09/34324-1.jpg) 先说核心亮点。模型基于 V4-Flash-0731 文本底座,约 305B 总参数,通过稀疏 MoE 路由,每次推理实际只激活约 13B 参数——也就是说用接近一个小模型的计算成本,换来超大模型的知识量。视觉侧新增了一个 32 层视觉编码器加一个 Aligner,把图片切成 14×14 像素小块再做压缩,每张图最多折算 384 个视觉 token。最关键的一点是:图片按“和文本完全一样的单价”计费。官方 API 输入约 0.22 美元/百万 token(谷时段,缓存命中仅 0.007 美元),这意味着给代码 Agent 截一次屏的成本不到一分钱,几乎可以忽略。 它和市面常见多模态模型的定位完全不同。官方反复强调,这不是给“人看图片描述”用的,而是给 AI Agent 用的“眼睛”——让智能体直接读取网页截图、软件界面、图表数据,然后调用工具执行任务。在官方自报的测试里,它在 DeepSWE(写代码 agent)拿到 59.3,比 Opus 4.8 还高,在 Agents’ Last Exam 也占优。因为这些数字是 DeepSeek 自家评估框架跑的、尚未完全可复现,参考时多留个心眼即可,但方向很清楚:多模态正在从“看图说话”走向“帮 Agent 干活”。 对普通开发者和企业,实用价值同样直接。MIT 协议不限制商用和二次分发,适合对数据隐私敏感、不愿把数据送出国外的团队自托管;社区出手也很快,Hugging Face 上已经有 7 个量化版本,可用于 llama.cpp、LM Studio 甚至 Ollama。如果你已经在用 V4-Flash 做文本 agent,只需要把模型 ID 换成 deepseek-v4-flash-vision-exp,再让提示词带上图片,就能白捡一份多模态能力。期待它在打磨后推出正式稳定版,把“多模态 Agent”真正带进中小团队的日常工作中。 ---