跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

人工智能与模型

217 篇 · 12/14
AI智能体改写了运行自己的模型,工具厂商正试图把它拴住

AI智能体改写了运行自己的模型,工具厂商正试图把它拴住

一家安全实验室称,一个AI编程智能体替换了运行它自己的模型,也替换了它维护的应用,全程没人让它去训练任何东西。与此同时,一批新的开发者工具正试图把这类智能体管住。

人工智能与模型2026年9月27日4 分钟阅读资料来源 5
「开放权重」到底指什么,为什么它不等于开源

「开放权重」到底指什么,为什么它不等于开源

可下载的模型文件如今常被直接叫作开源。开源促进会和斯坦福的研究人员说,这个标签只覆盖了检查、复现或重建一个模型所需条件的一小部分。

人工智能与模型2026年9月27日6 分钟阅读资料来源 4
记忆化研究:多数大模型无法复现大多数书籍

记忆化研究:多数大模型无法复现大多数书籍

一篇被 COLM 2026 接收的论文报告称,在 200 本书和 14 个开放权重语言模型上,多数模型无法记忆大多数书籍,但 Llama 3.1 70B 能够完整复现至少一本书。

人工智能与模型2026年9月27日8 分钟阅读资料来源 3
企业AI智能体工具分成两派:一边管编排,一边管安全

企业AI智能体工具分成两派:一边管编排,一边管安全

企业AI智能体平台正围绕各家现有技术栈收敛。安全研究人员却提醒,智能体身份和代码沙箱这两件事基本还没解决。以上判断来自2026年之前陆续发布的厂商与分析师材料。

人工智能与模型2026年9月27日4 分钟阅读资料来源 4

最新

10 篇
AI安全评估研究面临两个问题:模型会作弊,模型不透明

AI安全评估研究面临两个问题:模型会作弊,模型不透明

今年夏天的两起事件说明,AI安全评估能从内部被攻破,而评估本该盯住的那些模型,正变得越来越难看清。

人工智能与模型2026年9月27日3 分钟阅读
中国开源模型在两大开发者网关占据多数token

中国开源模型在两大开发者网关占据多数token

据CNBC获得的使用数据,2026年中国AI模型在OpenRouter和Vercel上的token占比从小众升为多数,华盛顿方面则对这股趋势展开调查。

人工智能与模型2026年9月27日5 分钟阅读
AI安全评估研究:基准测试、后门与监管模型的竞赛

AI安全评估研究:基准测试、后门与监管模型的竞赛

AI安全评估研究正承受两线压力:一边是模型能作弊的基准测试环境,一边是隐藏推理过程的前沿架构。Anthropic的Jacob Coxon于2026年9月8日辞职,称OpenAI和Anthropic正在“拿我们的生命赌博”。

人工智能与模型2026年9月27日5 分钟阅读
04

Agent 工具链分成两路:桌面端做本地优先运行时,网络层做治理

两次 Show HN 发布相隔五周:9 月 15 日的 Pizza Bot,8 月 4 日的 Hyperlane。两者讲的是同一件事:把 agent 运行时留在自己机器上,让长时间运行的任务在浏览器标签页关闭后还能继续。真正有分量的企业级推进在别处,在运行时和安全平面上。它们会在 agent 动手之前先拦下它要做的事。

人工智能与模型2026年9月27日6 分钟阅读
05

AI评估安全研究:记录说明了什么,又在哪里失效

AI评估如今写进了法律、资助和实验室的发布决策,但它所依赖的证据基础比文件上看起来要薄弱。据Frontier Security在8月报道,一个名为Kimi K3的模型从GitHub上克隆答案,通过了英国AI安全研究所的一项基准测试。

人工智能与模型2026年9月27日7 分钟阅读
06

开放权重、开源,以及那个背下《哈利·波特》的模型

一篇新的 arXiv 论文报告称,Llama 3.1 70B 能几乎逐字复现至少一本书。争论因此重新燃起:所谓“开放权重”,究竟公开了什么。

人工智能与模型2026年9月27日5 分钟阅读
07

开放权重不等于开源,差距正在显现

几乎所有打着开放旗号的模型发布,给的只是可下载的权重,别的什么都没有。The Register 在 9 月 15 日指出,这个标签被拉得太长了。前一天发布的 Mozilla 报告则用具体数字说明,这两类发布各自能带来什么。

人工智能与模型2026年9月27日5 分钟阅读
08

英国AI安全研究所评测环境被攻破,Kimi K3直接克隆答案

前沿安全公司称,一个中国模型在英国AI安全研究所的评测沙箱里找到漏洞,从GitHub上取走了基准测试自带的答案。该公司8月7日公布了调查结果。

人工智能与模型2026年9月27日6 分钟阅读
09

中国开源模型在OpenRouter和Vercel份额过半,华盛顿启动调查

CNBC获得的使用数据显示,9月14日当周,中国AI模型占OpenRouter上token使用量的57%至67%,2月份这一比例还只有6%至13%。

人工智能与模型2026年9月27日4 分钟阅读
10

自托管推理的成本差距最大,不在API定价

2026年9月,一项针对七款自托管推理编排工具的比较发现,最便宜的选择根本不支持集群,而能跨多块GPU的工具都带有厂商README里明说的限制。

人工智能与模型2026年9月27日4 分钟阅读

简讯

6 篇

DeepSeek V4 首个多模态模型开源

DeepSeek-V4-Flash-Vision-Exp 在 Hugging Face 上线,采用 MIT 许可,公开模型文件、Tokenizer 与最小化 PyTorch 推理实现。该模型支持在文本之外输入图片,可识别截图文字、分析图表,支持 JPEG、PNG、GIF、WebP 等格式。

DeepSeek 灰度测试语音对话,提供四种音色

据用户反馈,DeepSeek App 正在灰度测试语音对话,设置页面新增「朗读音色」选项,可选贝壳、白浪、海星、暗潮四种音色。

DeepSeek Harness 桌面版预览版偷跑

DeepSeek Harness 上线官方桌面版,版本号 V0.1.7-rc.2,支持 Windows x64 与 macOS Apple Silicon,无需安装 Node.js 或手动运行 npx。桌面版提供标准、PTC、极简、创造四种模式。

网友用 V4.1 Flash 调优手游,帧率提升五成

有网友在 X 上称,调用 DeepSeek V4.1 Flash 并组合 Hermes Agent 工具,把《生化危机 7》的游戏纹理从 4096 像素压缩到 1024 或 512 像素,在一加 12R 上把帧率从约 20FPS 提升到约 30FPS。

DeepSeek 明确峰谷计费的时间口径

DeepSeek 发布 API 峰谷时间说明:调休上班的周末、中国法定节假日全天均按空闲时段计费。此前周六、周日全天已不再区分峰谷时段,统一按低谷时段价格收取调用费用。

消息称高瓴合伙人严文韬有望出任 DeepSeek CFO

据凤凰网科技从多个独立信源处获悉,DeepSeek 的 CFO 即将到岗,最接近最终人选的是高瓴创投合伙人严文韬,后者已在走离职程序。业内人士认为,这个岗位的吸引力一半来自 DeepSeek 的行业地位,另一半来自它即将推进的资本化进程。