跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

MIT 许可下的开放权重:DeepSeek 究竟放出了什么

V4.1-Flash 的仓库和权重都采用 MIT 许可。此前的 2026 年 8 月 31 日,DeepSeek 用同样的方式开放了首个多模态模型 V4,也就是 Flash-Vision-Exp。

科技分析林晓雯发布: 2026年9月25日6 分钟阅读资料来源 3
MIT 许可下的开放权重:DeepSeek 究竟放出了什么

模型之争打到今天,许可本身就是最有力的论据之一。DeepSeek-V4.1-Flash 的模型卡写得很直接:仓库和模型权重都采用 MIT 许可。这是限制最少的开源许可之一,既不要求公开改动,也不限制商业使用。

这次开放的规模比看上去更大。Hugging Face 仓库里有 48 个 safetensors 格式的权重文件,旁边还有一整套工具。它没有 Jinja 格式的对话模板,但提供了独立的 Python 编码示例代码,支持多轮对话、工具调用、推理模式、数值化的推理强度,也能处理嵌入文本流的图像。

不只是模型文件

互操作性声明本身就是价值。同一份模型卡列出了面向 vLLM、SGLang、TensorRT 和 Docker Model Runner 的部署变体,以及 FP8、BF16、GPTQ、AWG 和 GGUF 量化。它还列出了外部推理服务商:novita、fireworks、featherless、deepinfra 等,这些服务商自行运行该模型。模型也能在 llama.cpp、Ollama 和 LM Studio 中运行。换句话说,权重不是“纸面开放”,确实可以在厂商基础设施之外跑起来。

DeepSeek 在 2026 年 8 月 31 日迈出了同一方向的前一步。中国门户 IT之家当时记录,DeepSeek-V4-Flash-Vision-Exp 是 V4 系列首个多模态模型,自 2026 年 8 月 21 日起在 API 中可用,同样以 MIT 许可登上 Hugging Face。开放的不仅是模型文件和 tokenizer,还有提示编码的示例实现,以及 PyTorch 最小推理实现,涵盖视觉编码器、aligner、DFlash 注意力、MoE、超连接和 DSpark。模型接受 JPEG、PNG、GIF 和 WebP 图像,厂商将其标为实验版本。

开放作为商业武器

这不是无私之举。意大利媒体 CorCom 在 2026 年 9 月 7 日的分析中写道,来自中国的低价开放权重模型可能压缩开发最昂贵 AI 系统的公司的利润空间。文章作者是 Banque Lombard Odier 的 Filippo Pallotti 和 Michael Strobaek。他们补充了一个限定:中国模型的优势被高估了,因为蒸馏以及任务完成所需的成本和时间可能抬高实际工作成本,即便每 token 价格看起来很漂亮。这是对 MIT 许可热潮的重要补充:免费权重不等于免费部署。

不过模型卡显示,上个月 621396 次下载说明,仅权重可获取这一点就吸引着工程师,与利润之争无关。

评论 0

资料来源

3
  1. 01DeepSeek-V4.1-Flash — sekcja License i wdrożeniaEN
  2. 02DeepSeek-V4-Flash-Vision-Exp 模型已开源 (IT之家)ZH
  3. 03AI, la Cina sfida i big Usa sui prezzi (CorCom)IT

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。