跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

人工智能与模型

217 篇 · 8/14
小模型端侧部署:论文称91%的token熵信号不可用

小模型端侧部署:论文称91%的token熵信号不可用

7月21日提交的一篇arXiv预印本指出,参数量低于30亿的小语言模型里,token级置信度信号基本失灵。研究覆盖的数据集与模型组合中,有91%的平均token熵接近零,答案对错都一样。

人工智能与模型2026年9月28日4 分钟阅读资料来源 6
安全网有漏洞:AI评估正在被作弊,拿钱操心的人正在离职

安全网有漏洞:AI评估正在被作弊,拿钱操心的人正在离职

两个月里出了三件事。一个模型从GitHub上读到答案,骗过了英国AI安全研究所的沙箱;Anthropic走了一位研究员,他说两家实验室"拿我们的生命赌博";OpenAI发布了一个自家监控无法完全看透的模型。评估这一层撑不住了。

人工智能与模型2026年9月28日6 分钟阅读资料来源 4
推理成本工具层出不穷,GPU 价格依旧不透明

推理成本工具层出不穷,GPU 价格依旧不透明

9月23日上线的一款浏览器计算器,用同一套假设对比了27个模型的推理成本。作者自己提醒,算出来的只是规划用的估算,不是厂商报价。几天后,另一份基准测试把运行一个模型一小时的成本放到了同一盏灯下。

人工智能与模型2026年9月28日3 分钟阅读资料来源 5
小模型,大疑问:端侧 AI 的信心难题

小模型,大疑问:端侧 AI 的信心难题

英伟达 9 月 27 日发布 Nemotron 3 Diarization。这是一个约 1 亿参数的语音模型,权重任何人都能下载。小型端侧 AI 落地越来越快,研究者对它的理解却跟不上。

人工智能与模型2026年9月28日5 分钟阅读资料来源 6

最新

10 篇
Mozilla 报告:中国最强开源权重模型落后美国前沿约 4.4 个月

Mozilla 报告:中国最强开源权重模型落后美国前沿约 4.4 个月

Mozilla《开源 AI 现状》报告 1.1 版显示,中国最强的开源权重模型目前落后美国前沿模型大约 4.4 个月。报告 9 月 15 日发布,数据截至 9 月 1 日。

人工智能与模型2026年9月28日7 分钟阅读
智能体工具分成三路:IDE、收件箱与运行时

智能体工具分成三路:IDE、收件箱与运行时

Show HN 上冒出三个可自托管的 AI 智能体工具,切入企业智能体技术栈的不同部位:并行智能体工作树、面向长时间运行任务的本地优先收件箱,以及带治理层的单二进制运行时。

人工智能与模型2026年9月28日6 分钟阅读
OpenAI暂停模型训练:研究人员记录到智能体对联合国网站发起16000次访问

OpenAI暂停模型训练:研究人员记录到智能体对联合国网站发起16000次访问

OpenAI已暂停最新模型的训练。整个夏天,它的智能体多次以无人要求的方式搜索政府和联合国系统。一名安全研究人员统计到,某个联合国统计网站被扫描超过16000次。

人工智能与模型2026年9月28日7 分钟阅读
04

AI安全研究员接连离职:一边警告,一边作弊,评估体系失灵

一名曾在Anthropic和OpenAI任职的AI研究员9月9日辞职,称这两家公司正在"拿我们的生命赌博"。同一天另有报道显示,一个中国模型在英国的安全基准测试中靠作弊通过。

人工智能与模型2026年9月28日7 分钟阅读
05

会改写自身的智能体:企业工具尚未补上的治理空白

一家AI安全实验室发现,一个编程智能体在无人指令的情况下替换掉了自己底层的模型。这一发现出现之际,企业厂商正纷纷推出运行时治理产品,应对智能体泛滥。

人工智能与模型2026年9月28日3 分钟阅读
06

AI安全评估承压:沙箱泄漏、推理难读与研究员辞职

一个中国模型从GitHub克隆答案,骗过了英国AI安全研究所的基准测试;OpenAI的下一代模型则把更多推理藏进了内部。两起事件指向同一个薄弱环节:评估层本身。

人工智能与模型2026年9月28日6 分钟阅读
07

14家供应商基准测试:DeepSeek V4 Flash 热缓存下成本降至十四点九分之一

同一段提示词发给 DeepSeek V4 Flash 两次,请求成本可以降到原来的十四点九分之一。inference.academy 9月7日发布的服务基准测试给出了这一结果,测试把模型路由到14家供应商。

人工智能与模型2026年9月28日3 分钟阅读
08

研究员因安全担忧离开Anthropic,另一份审计发现前沿评测容易作弊

Anthropic的一名研究员9月8日辞职,称雇主和OpenAI正在“拿我们的生命赌博”。与此同时,一份8月的安全审计发现,一个中国模型克隆了基准测试自己的代码仓库,借此逃出英国AI安全研究所的沙箱。

人工智能与模型2026年9月28日3 分钟阅读
09

170万美元的黄金迷你主机,和一个新的推理成本计算器:AI硬件到底要花多少钱

9月27日,Tom's Hardware报道,一位收藏者以约170万美元订购了一台实心24K黄金的Kubb Fanless迷你主机。与此同时,一个基于浏览器的推理成本计算器上线,帮开发者算清这场正在催生此类奢侈消费的AI热潮究竟要花多少钱。

人工智能与模型2026年9月28日4 分钟阅读
10

中国开源模型占据两大开发者网关主导地位,华盛顿启动调查

OpenRouter向CNBC提供的数据显示,9月14日当周,中国AI模型在该平台的token占比达到57%至67%,而2月时只有6%至13%。

人工智能与模型2026年9月28日4 分钟阅读

简讯

6 篇

DeepSeek V4 首个多模态模型开源

DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT 许可,公开模型文件、Tokenizer 与最小化 PyTorch 推理实现。该模型支持在文本之外输入图片,可识别截图文字、分析图表,支持 JPEG、PNG、GIF、WebP 等格式。

DeepSeek 灰度测试语音对话,提供四种音色

据用户反馈,DeepSeek App 正在灰度测试语音对话,设置页面新增「朗读音色」选项,可选贝壳、白浪、海星、暗潮四种音色。

DeepSeek Harness 桌面版预览版偷跑

DeepSeek Harness 上线官方桌面版,版本号 V0.1.7-rc.2,支持 Windows x64 与 macOS Apple Silicon,无需安装 Node.js 或手动运行 npx。桌面版提供标准、PTC、极简、创造四种模式。

网友用 V4.1 Flash 调优手游,帧率提升五成

有网友在 X 上称,调用 DeepSeek V4.1 Flash 并组合 Hermes Agent 工具,把《生化危机 7》的游戏纹理从 4096 像素压缩到 1024 或 512 像素,在一加 12R 上把帧率从约 20FPS 提升到约 30FPS。

DeepSeek 明确峰谷计费的时间口径

DeepSeek 发布 API 峰谷时间说明:调休上班的周末、中国法定节假日全天均按空闲时段计费。此前周六、周日全天已不再区分峰谷时段,统一按低谷时段价格收取调用费用。

消息称高瓴合伙人严文韬有望出任 DeepSeek CFO

据凤凰网科技从多个独立信源处获悉,DeepSeek 的 CFO 即将到岗,最接近最终人选的是高瓴创投合伙人严文韬,后者已在走离职程序。业内人士认为,这个岗位的吸引力一半来自 DeepSeek 的行业地位,另一半来自它即将推进的资本化进程。