跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

人工智能与模型

217 篇 · 13/14
开放权重到底能给你什么,又不能给你什么

开放权重到底能给你什么,又不能给你什么

开放权重发布让下载语言模型、在自己的硬件上运行变得很容易。但这个标签对训练数据、代码和许可证只字不提。这一空白如今成了撰写开源定义的人之间公开争论的焦点。

人工智能与模型2026年9月27日5 分钟阅读资料来源 3
小语言模型走向端侧,置信度信号却跟不上

小语言模型走向端侧,置信度信号却跟不上

苹果的 OpenELM 系列覆盖 2.7亿到 30亿参数,谷歌的 Gemma 3n 已支持文本、图像、视频和音频输入。但一篇 2026 年的 arXiv 论文报告说,在 30亿参数以下的模型里,词元级熵实际上已经失效。

人工智能与模型2026年9月27日7 分钟阅读资料来源 6

最新

9 篇
备案逼近 1200 款:中国 AI 治理的两条线索

备案逼近 1200 款:中国 AI 治理的两条线索

国家网信办公告显示,截至 2026 年 8 月 31 日累计有 1112 款生成式人工智能服务完成备案;与此同时,《人工智能安全治理框架 3.0》在网络安全宣传周上发布。

人工智能与模型2026年9月25日6 分钟阅读
Terminal-Bench 与 DeepSWE:V4.1 Flash 在代理任务上反超前沿模型

Terminal-Bench 与 DeepSWE:V4.1 Flash 在代理任务上反超前沿模型

模型卡的对比表显示,V4.1-Flash 在 Terminal-Bench 2.1 上拿到 90.6 分,在 DeepSWE v1.1 上拿到 74.2 分,与 Opus-5.0、GPT-5.6 Sol、K3 和 GLM-5.3 持平,甚至更高。

人工智能与模型2026年9月25日7 分钟阅读
备案逼近 1200 款:中国 AI 治理的两条线索

备案逼近 1200 款:中国 AI 治理的两条线索

国家网信办公告显示,截至 2026 年 8 月 31 日累计有 1112 款生成式人工智能服务完成备案;与此同时,《人工智能安全治理框架 3.0》在网络安全宣传周上发布。

人工智能与模型2026年9月25日6 分钟阅读
04

DeepSeek 的资本化提速:拟年内启动 IPO,第二轮融资目标 500 亿元

据路透社与 The Information 报道,DeepSeek 已聘请中信证券筹备科创板上市,并在推进目标 500 亿元人民币的第二轮融资;公司年化营收据称已突破 10 亿美元。

人工智能与模型2026年9月24日6 分钟阅读
05

DeepSeek 拟年内启动 IPO,第二轮融资目标 500 亿元

路透社与 The Information 报道,DeepSeek 已聘请中信证券筹备科创板上市,并推进目标 500 亿元人民币的第二轮融资;公司年化营收据称已突破 10 亿美元。

人工智能与模型2026年9月24日6 分钟阅读
06

算力之争不再是堆卡:从 IDC 报告看国产智算的两条路

在 AICC 2026 上,IDC 报告把算力缺口拆成能力上限与产能两个方向:到 2030 年算力缺口绝对值或达 3809 亿美元,单纯堆卡已难以覆盖 Prefill 与 Decode 的不同负载。

人工智能与模型2026年9月23日7 分钟阅读
07

算力之争不再是堆卡:从 IDC 报告看国产智算的两条路

在 AICC 2026 上,IDC 报告把算力缺口拆成能力上限与产能两个方向:到 2030 年算力缺口绝对值或达 3809 亿美元,单纯堆卡已难以覆盖 Prefill 与 Decode 的不同负载。

人工智能与模型2026年9月23日7 分钟阅读
08

小米直播训练模型,六天烧掉350万美元

MiMo-V2.6-Pro 有 1.02 万亿参数,其中 420 亿为激活参数。公开直播的强化学习训练结束后,它在 Artificial Analysis 智能指数上拿到 46 分,在开放模型里排第一。

人工智能与模型2026年9月23日5 分钟阅读
09

开源大模型的这半年:小米 MiMo、DeepSeek 与 HuggingFace 上的中文模型

小米把一场强化学习训练搬进直播间,MiMo-V2.6-Pro 以 1.02 万亿参数、420 亿激活登上开源榜首;与此同时,DeepSeek 的视觉实验版也以 MIT 许可开源。

人工智能与模型2026年9月23日6 分钟阅读

简讯

6 篇

DeepSeek V4 首个多模态模型开源

DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT 许可,公开模型文件、Tokenizer 与最小化 PyTorch 推理实现。该模型支持在文本之外输入图片,可识别截图文字、分析图表,支持 JPEG、PNG、GIF、WebP 等格式。

DeepSeek 灰度测试语音对话,提供四种音色

据用户反馈,DeepSeek App 正在灰度测试语音对话,设置页面新增「朗读音色」选项,可选贝壳、白浪、海星、暗潮四种音色。

DeepSeek Harness 桌面版预览版偷跑

DeepSeek Harness 上线官方桌面版,版本号 V0.1.7-rc.2,支持 Windows x64 与 macOS Apple Silicon,无需安装 Node.js 或手动运行 npx。桌面版提供标准、PTC、极简、创造四种模式。

网友用 V4.1 Flash 调优手游,帧率提升五成

有网友在 X 上称,调用 DeepSeek V4.1 Flash 并组合 Hermes Agent 工具,把《生化危机 7》的游戏纹理从 4096 像素压缩到 1024 或 512 像素,在一加 12R 上把帧率从约 20FPS 提升到约 30FPS。

DeepSeek 明确峰谷计费的时间口径

DeepSeek 发布 API 峰谷时间说明:调休上班的周末、中国法定节假日全天均按空闲时段计费。此前周六、周日全天已不再区分峰谷时段,统一按低谷时段价格收取调用费用。

消息称高瓴合伙人严文韬有望出任 DeepSeek CFO

据凤凰网科技从多个独立信源处获悉,DeepSeek 的 CFO 即将到岗,最接近最终人选的是高瓴创投合伙人严文韬,后者已在走离职程序。业内人士认为,这个岗位的吸引力一半来自 DeepSeek 的行业地位,另一半来自它即将推进的资本化进程。