← AI 日报归档 返回首页

AI 日报:2026-08-09

今日重点:AI 的成本账单成为大公司头号问题——SAP 停招、亚马逊百万美元 Agent 事故;OpenAI 一边收购一边因安全放缓模型;Agent 的浏览器、技能库与自改进成为开源热点;阿里视频生成与两篇 Agent 论文值得跟进。

1. SAP 因 AI 成本飙升暂停大部分差旅与招聘
404media 援引内部备忘录报道,全球头部软件企业 SAP 上月起暂停大部分差旅和招聘,仅 AI 相关的差旅与招聘获得例外,公司称需要在支出上"保持纪律"。该报道基于内部文件独家披露,具体影响范围以 SAP 官方表态为准。
💡 值得看:当软件巨头把"AI 成本"列为冻结开支的理由,生成式 AI 的账单已经从工程问题变成了 CFO 问题。
🔗 404media 原始报道(Hacker News 今日头条)
2. 亚马逊一个 Claude Agent 任务烧掉约 180 万美元
量子位 8 月 9 日援引亚马逊员工说法报道,公司内部一个用 Claude Sonnet 为网站生成作者信息的 Agent 任务因反复重试产生约 180 万美元调用成本,项目最终未成功部署;文章同时引用亚马逊最新财报:AWS 二季度净销售额 422 亿美元、同比增长 37%。员工爆料属单方说法,账单细节有待核实。
💡 值得看:Agent 的"日夜重试"能让一次小任务变成百万美元账单,成本护栏正在成为企业落地 AI 的第一道考题。
🔗 量子位原始报道
3. OpenAI 收购演示文稿初创公司 NextSlide
TechCrunch 8 月 8 日报道,OpenAI 收购了演示文稿初创公司 NextSlide;NextSlide 表示其团队成员现已加入 ChatGPT 团队。交易金额未披露。
💡 值得看:收购一个"做 PPT 的小团队"放进 ChatGPT,说明 OpenAI 正在用并购补足生产力场景的产品细节,而不只是堆模型能力。
🔗 TechCrunch 原始报道
4. OpenAI 以安全为由放缓 Astra 模型开发
TechCrunch 8 月 7 日报道,OpenAI 称开发中的 Astra 模型已达到其设定的"关键网络安全阈值",即能够独立识别并对现实世界中防护良好的系统发起网络攻击,公司因此放缓了开发节奏;量子位同日以"奥特曼亲手封锁最强模型 Astra"为题报道了同一事件。
💡 值得看:前沿模型的发布节奏正在由"能不能做"变成"敢不敢放",安全护栏成了决定模型何时上线的主要变量。
🔗 TechCrunch 原始报道量子位报道
5. Cloudflare 推出 Kitesurf:为 AI Agent 打造的云浏览器
TechCrunch 8 月 7 日报道,Cloudflare 发布 Kitesurf——一个面向 AI Agent 而非人类的云端浏览器,处理常见自动化任务时比 Chromium 消耗更少算力,帮助开发者更高效地构建浏览器型 Agent。
💡 值得看:浏览器正在从"给人用"变成"给 Agent 用"的接口层,云浏览器说明 Agent 基建开始按算力成本重新设计。
🔗 TechCrunch 原始报道
6. agent-skills:超 8.4 万 star 的 AI 编码 Agent 技能库
GitHub 趋势榜显示,addyosmani/agent-skills 仓库本周持续霸榜,star 数已超 8.4 万,定位是"面向 AI 编码 Agent 的生产级工程技能库",把资深工程师的工作流、质量门禁与最佳实践封装成 Agent 可遵循的技能;同期 Google 官方 skills 仓库(约 1.7 万 star)也在榜上,多家项目跟进"skills"概念。
💡 值得看:"技能库"正在成为 Agent 时代的新分发形态——把经验打包给 Agent 用,可能比提示词工程更接近下一代工作流。
🔗 GitHub 仓库Google skills 仓库
7. prime-agent 登上 GitHub 趋势榜首:自改进编码 Agent
GitHub 今日趋势榜首为 PrimeIntellect 的 prime-agent(约 9.7 千 star,今日仍有更新),官方描述为"面向编码工作流与长时自主任务的自我改进 RLM Agent";PrimeIntellect 此前以去中心化模型训练知名。
💡 值得看:从"调 API"到"让 Agent 自己改进自己",开源社区正在把自我改进从论文概念变成可跑的工作流。
🔗 GitHub 仓库
8. 阿里 Wan 3.0 视频大模型开启公测
量子位报道,8 月 6 日阿里巴巴视频生成大模型 Wan 3.0 开启公测:单次可生成 30 秒视频,首次支持 doc、xls、ppt、pdf、md 等文档格式输入,并在人物一致性与真实世界还原等维度升级。
💡 值得看:把"文档变视频"做成公测功能,说明视频生成正在从炫技转向办公场景的可用性竞争。
🔗 量子位原始报道
9. arXiv 论文:工具调用的"苦涩教训"
arXiv 预印本《The Bitter Lesson of Tool Calling》(2608.06370)提出,对具备编程能力的模型,应把工具调用从固定 JSON 换成可自然串联与并行的脚本,并指出现有基准缺乏对"工具即代码"跨模型世代的系统评测。论文尚未经过同行评审。
💡 值得看:工具调用协议正在从 JSON 走向代码,这可能是 Agent 能力下一个量级提升的隐藏杠杆。
🔗 arXiv 原始论文
10. arXiv 论文:让 Agent 评测便宜 74 倍
arXiv 预印本《AV-AIVAT》(2608.06362)提出带"随时有效停止"认证的 Agent 评测方法,在信息不完全博弈场景下平均可将评测成本降低约 74 倍,既避免固定预算下多花钱,也避免过早停止下错误结论。论文为预印本,尚未经过同行评审。
💡 值得看:Agent 评测每局都要花钱,"什么时候停止对局"是一个统计问题——这篇论文把停止规则变成了可认证的省钱工具。
🔗 arXiv 原始论文