ServiceNow AutoSynthData:将智能体失败转化为训练数据
ServiceNow于10月2日发布了一套企业级智能体流水线,利用模型自身的失败生成新的训练任务,旨在解决阻碍部署的检索和工具使用缺陷。四名ServiceNow研究员在Hugging Face上详细介绍了AutoSynthData。

这套流水线名为AutoSynthData。根据10月2日发布的工程文章,它利用目标模型的失败和更强教师模型的成功,决定模型下一步应学习什么,然后生成并验证能锻炼这些能力的新任务。
这很重要,因为企业级智能体问题在很大程度上是检索问题。如果一个智能体无法在正确时刻找到正确的政策、资产记录或工作笔记,任务就会失败,而单次失败不足以用于训练。
ServiceNow的作者Esakkivel Esakkiraja、Shruthan Radhakrishna、Denis Akhiyarov和Sagar Davasam直白地描述了这一差距:模型可能具备广泛能力,但仍可能在特定环境、处理不佳的工作流、误用的工具组合或未能遵守的约束上挣扎。文章为生成的任务设定了三个条件:可行性、真实性和难度;为评分结果的验证器设定了三个条件,以一致性为首。验证层是承重部分:如果没有可靠的检查,合成任务什么都教不了。ServiceNow在企业运营健身房(EnterpriseOps Gym)上演示了该方法,这是一个今年随论文发布的基准。它是同期落地的一系列研究努力之一,从不同角度攻击同一个问题:如何让企业系统扎根于它们真正可以行动的情境中。
检索质量成为可衡量变量
9月30日,两篇提交至arXiv的预印本论文瞄准了企业检索下方的表示层。Merieme Askour和Ayoub Merimi提出了生成式AI个性化中的情境充分性理论,主张一旦情境提供变得廉价,更多并不意味着更好。
他们的框架识别出四种状态:不充分、充分、饱和和干扰,并定义了情境充分性前沿(Context-Sufficiency Frontier)以定位最小相关集。在一项针对大型家居零售商生成式推荐系统的全因子实验中,相关情境提高了适当性,而不相关情境降低了适当性并导致检索不稳定。
第二篇论文来自Terry Dorsey和Kevin Huggins,引入了企业表示简化(Enterprise Representation Simplification)和一个名为企业表示复杂性(Enterprise Representation Complexity)的表示中性模型。作者认为,企业信息积累了由应用、项目和组织边界塑造的结构,这种表示复杂性必须由人类和AI系统共同维护和解释。他们对检索从业者的关键主张是:任务级复杂性的降低减少了AI系统必须识别、关联和解释的表示范围,且文本到SQL的研究提供了证据,表明降低模式和推理复杂性可以提高准确性。作者谨慎地指出,ERC不是通用的复杂性、性能或成本指标。
这两篇论文都没有发布产品。但它们指向相同的诊断:向检索系统投入更多情境,并不等同于给予充分的情境,这种差异在生产环境中表现为不稳定的答案。
身份是情境落地问题的另一半
Hacker News于9月28日发布了一个关于AI智能体身份和访问管理的框架,并命名了检索团队往往发现较晚的一种失败模式。IAM平台表达预期的访问,而应用和基础设施揭示智能体实际执行的内容。
两者之间存在文章所称的身份暗物质:中央身份数据从未报告的智能体、凭证、应用本地账户和认证路径。文章引用了OWASP的大语言模型应用十大风险,其中将过度代理列为LLM06,并列举了五种常见失败,包括所有权缺失、长期秘密和无限制委托。
检索角度很直接。被授予广泛权限的智能体可以拉取它从未被授权查看的数据,静态角色分配无法限制这种行为。配置发现描述可能性;遥测描述发生了什么。
云厂商将管道下沉至栈底
InfoQ报道,微软于10月1日宣布Azure Container Apps Express正式可用,同时Azure Container Apps Sandboxes(Express运行的隔离计算层)也正式可用。Express接收容器镜像、区域和应用所需的配置,然后自行配置计算、入口和扩展。它运行在消费型CPU上,按秒计费,空闲时缩容至零。
微软将Express描述为开发者优先和智能体优先,其文档指出它完全构建在Sandboxes上,Sandboxes从预热池配置以实现亚秒级启动,在每个硬件隔离的microVM边界中隔离每个工作负载,并支持亚秒级恢复的挂起和恢复。开发者可以直接使用Sandboxes,微软将该路径定位为智能体平台和安全代码执行服务。Reddit上的反应表明该原语在公告前已在使用;一位评论者MuhBlockchain声称ACA Sandboxes支撑包括Foundry Hosted Agents在内的核心Azure服务,这是微软自身材料中未提及的细节。
CoreWeave一天前朝同一方向行动。据Data Center Knowledge报道,CoreWeave在9月30日旧金山的Fully Connected活动上发布了CoreWeave Forge,这是一个用于开发、运行和改进AI模型和智能体的集成软件平台。Forge提供Free、Pro和Enterprise版本,包括CoreWeave Notebooks、用于生产智能体可观测性的Agent Lens,以及RL Rollouts。
CoreWeave高级产品管理副总裁Corey Sanders在媒体简报会上表示,公司已从专注于成为最佳AI中心基础设施提供商,转向提供让客户在其平台上构建应用的AI服务。IDC分析师Dave McCarthy告诉Data Center Knowledge,CoreWeave需要更广泛的企业受众和更大的软件生态系统才能建立可持续的业务。
需求来自哪里
中国互联网络信息中心报告,中国生成式AI用户群在6月底超过7亿,较2025年底的60200万增长16%,当时渗透率为42.8%。《南华早报》在9月29日报道了这一发布,指出76%的受访用户表示使用生成式AI寻求答案,48%用于处理图像或视频,38%用于文本处理。
这些是消费者数字,不是企业数字。但它们设定了企业检索系统现在被衡量的期望基线,并解释了为什么栈中的厂商都在竞相让智能体输出看起来不那么像猜测。
下方的基础设施约束是真实的。Data Center Knowledge在9月24日报道,光学频率梳发生器(从单个激光产生多个波长,而不是每个通道一个激光)被推介为一种在AI数据中心扩展超过每光纤16波长时减少功耗、成本和故障点的方法。Pilot Photonics创始人兼CTO Frank Smyth表示,梳状激光潜在地允许更密集地打包许多波长,无需担心干扰。Solinide首席执行官兼联合创始人Marcello Girardi直白地指出实际极限:四个波长对于激光阵列是已解决的问题,困难从八个开始,到16时组件数量限制了扩展。Quintessent的Steven Estrella补充说,鉴于当前磷化铟CW DFB激光器供应短缺,减少所需激光器数量比以往任何时候都更重要。
企业买家也在重新思考推理在哪里运行。Data Center Knowledge在9月21日引用VMware的《2026私有云展望》,显示83%的企业已完成或计划将工作负载从公共云迁回,驱动力是安全、成本、合规和性能问题。现代托管设施支持带空气冷却的35 kW机柜和带可选液体冷却的70到150 kW机柜,这是机密企业数据推理往往落地的地方。
这些本身都不解决检索问题。但过去一周的方向是一致的:行业正在将情境、表示和身份视为工程变量,而不是需要调整提示词。这比连接向量存储更难,也是决定智能体能否被信任执行工作的关键。
资料来源
14- 01AutoSynthData: Generating Training Data for Enterprise AgentsEN
- 02When More Data Is Not Enough: The Context-Sufficiency Frontier in Generative AI PersonalizationEN
- 03Enterprise Representation Simplification (ERS): Reducing Representational Complexity for Enterprise AIEN
- 04IAM for AI agents: A Practical Enterprise FrameworkEN
- 05Container Apps Express Reaches GA on a Newly Generally Available Sandbox LayerEN
- 06CoreWeave Targets Enterprises with Forge PlatformEN
- 07China's generative AI user base crosses 700 million, covering over half the populationEN
- 08The Role of Optical Frequency Comb Generators in AI Data CentersEN
- 09Enterprises Adopt Colocation for AI and Hybrid Cloud InitiativesEN
- 10Redefining enterprise intelligence with autonomous AIEN
- 11ShamAN-Q: Shampoo Augmented NanoQuant for Sub-1-bit LLM WeightsEN
- 12ReLaG: A Scalable Framework Generalizing Random Splits to Data with Latent RelationsEN
- 13Conformal Adversarial Generative EnsembleEN
- 14This startup helps food carts switch loud, dirty generators for batteriesEN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。