月报
AI 行业月度趋势观察
本月从 31 期日报中整理出 551 个独立事件,呈现 5 条持续演进的行业主线。
模型发布/更新
Model Releases本月模型发布/更新收录 8 个独立事件,重点包括“Claude Sonnet 5 发布”、“推出 Grok 4.5”。
Claude Sonnet 5 发布
Claude Sonnet 5 是 Anthropic 推出的最新 Sonnet 模型,具备计划、浏览器和终端工具使用能力,可自主运行。性能接近 Opus 4.8,定价更低:即日起至 2026 年 8 月 31 日,输入 token $2/百万,输出 $10/百万,之后恢复为 $3/百万输入和 $15/百万输出。相比 Sonnet 4.6,在推理、工具使用、编程和知识工作等智能体能力上大幅提升。在 BrowseComp 和 OSWorld-Verified 评测中严格优于 Sonnet 4.6。安全评估显示不良行为率更低,幻觉和谄媚减少,但网络安全能力弱于 Opus 4.8。即日起在所有套餐及 Claude Code、Claude …
推出 Grok 4.5
Cursor 与 SpaceXAI 联合训练了混合专家模型 Grok 4.5,在数万亿 tokens 的 Cursor 用户交互数据上训练,并通过强化学习解决软件工程、数据科学、金融、法律等领域的困难问题。基础版定价 $2/M 输入 tokens、$6/M 输出 tokens,快速版 $4/M 输入 tokens、$18/M 输出 tokens。即日起在 Cursor 桌面、网页、iOS、CLI 及 SDK 中可用,个人和团队计划首周使用量翻倍。Grok 4.5 与 Composer 2.5 为不同权重类别,两者将继续支持。
NVIDIA 发布 Nemotron-Labs-3-Puzzle-75B-A9B:压缩混合 MoE 模型,服务器吞吐量提升 2.03 倍
NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB 降至 44.5 GB。迭代式 Puzzle 方法平均得分比单步高 0.57。代价:Arena-Hard-V2 降 4.2 分、SWE-Bench 降 2.6 分。…
商汤开源 SenseNova-Vision-7B-MoT 多任务视觉模型
商汤发布并完全开源 SenseNova-Vision-7B-MoT,一个统一处理检测、OCR、GUI、深度与法线估计、分割、多视图等主要视觉任务的模型。该模型支持通过自然语言定义新的视觉任务变体,跨传统任务边界重组视觉能力。开源内容包括模型权重及 SenseNova-Vision Corpus(含 5000 万示例子集及复现剩余公开数据的完整工具包)。
NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一
NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。
上海科学智能研究院开放科学多模态基础模型“神珍”
上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。
Midjourney V8.2 发布:专注美学提升与个性化理解
Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。
Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人
Google DeepMind 推出 Gemini Robotics ER 2,一个基于 Gemini 的机器人基础模型。该模型在视频理解、工具编排和多机器人协作方面实现阶跃式提升,使机器人能够推理、协作并解决真实世界任务。
产品发布/更新
Products本月产品发布/更新收录 8 个独立事件,重点包括“X(Twitter)发布 hosted X MCP,AI 智能体可直连 X API”、“阿里巴巴发布 Page Agent:开源 JavaScript 库实现网页 DOM 自然语言操控”。
X(Twitter)发布 hosted X MCP,AI 智能体可直连 X API
X(Twitter)官方推出 hosted X MCP,AI 智能体可通过 MCP 协议直接调用 X API 获取实时信息,支持 Grok、Cursor 等工具。用户需注册 X API 并按量付费,个人优惠价每次调用 0.01 美元(1 美元 1000 次)。有用户实测拉取近三天书签仅花 0.1 美元。配置步骤:创建 APP 并充值、获取配置 ID、辅助配置(可交给 Codex/Claude)、授权启动。
阿里巴巴发布 Page Agent:开源 JavaScript 库实现网页 DOM 自然语言操控
阿里巴巴发布 Page Agent,一个开源的 JavaScript 客户端库,嵌入网页后可通过自然语言指令直接操作 DOM 元素。与 Playwright、Puppeteer 等外部浏览器自动化工具不同,Page Agent 不依赖截图或多模态模型,而是将实时 DOM 脱水压缩为 FlatDomTree 文本映射,让纯文本模型精准执行点击、表单填写等操作。它继承用户 cookies 和会话,无需独立后端,并支持任意 OpenAI 兼容端点的模型(示例使用 `qwen3.5-plus`)。项目采用 MIT 许可证,适合在自有应用内构建 AI 副驾、智能表单填充或无障碍控制等场景,但限于单页面范围,风险操作仍需服务端验证。
Claude Code v2.1.203 发布
本次更新新增登录过期警告和手动权限模式标记,并将附加工作目录加入 MCP roots/list。修复了 macOS 下因内存检测误报导致后台会话卡顿 15–20 秒(回归自 2.1.196)、后台会话因 token 过期永久不可用(现自动恢复)、交互式会话中上下文指示器每轮重分析整个对话导致 CPU 和内存回归等问题。同时改进了长响应流时的实时预览性能,并降低了子代理重新委托任务的倾向。二进制体积减少约 7 MB,启动内存减少约 7 MB。左侧箭头不再关闭后台任务/差异/工作流详情视图,改为 Esc。
Codex与ChatGPT Work多项更新:取消5小时限制
早上好。过去48小时里,Codex和ChatGPT Work非常忙碌!三项重要更新: - 暂时取消所有Plus、Business和Pro计划的5小时使用限制 - 正在推出变更,使GPT 5.6 Sol整体更高效,这将体现在使用量减少上,从而让你能走得更远。具体影响待量化后公布 - 我们已达到600万活跃用户,并将在接下来一小时内进行使用量重置 去创造吧。
秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级
百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。
Google 推出 Tunix:基于 JAX 的高吞吐智能体后训练库
Google 发布 Tunix,一个基于 JAX 的原生后训练库,旨在消除多轮、使用工具的 LLM 推理智能体训练中的 TPU 闲置瓶颈。Tunix 通过高并发异步 rollout 与解耦的生产者-消费者流水线最大化硬件吞吐量,确保训练器持续获得数据。该库提供即插即用抽象和持续宏观级性能分析,便于集成自定义环境。
OpenAI 发布 Codex 安全 CLI 与 SDK
更多开源福利。我们刚刚发布了一个 CLI 和 TypeScript SDK,用于查找、验证和修复代码中的安全漏洞。扫描仓库、审查变更、随时间追踪发现,并在 CI 中运行安全检查。 https://github.com/openai/codex-security
AlloyDB 推出 IAM 群组认证预览版,强化企业级与 AI 智能体安全
Google Cloud 宣布 AlloyDB 推出 IAM 群组认证(预览版),允许安全团队通过最多 200 个 Google Groups 管理数据库访问。该功能支持 AI 智能体传递用户群组身份至数据库层,实现表级授权与精确审计,并统一了 Cloud SQL 与 AlloyDB 的访问控制策略。
行业动态
Industry本月行业动态收录 8 个独立事件,重点包括“特斯拉Cybercab量产版在奥斯汀启动公开道路工程测试”、“国家网信办就《互联网信息服务管理办法》再次征求意见,首设“智能信息服务”专章规范AI服务”。
特斯拉Cybercab量产版在奥斯汀启动公开道路工程测试
2026年6月30日,特斯拉在奥斯汀公共道路启动首批量产版Cybercab工程测试。车辆无方向盘与脚踏板,配有安全监督员,马斯克发布实拍视频。从2024年10月概念车首秀到实车上路约20个月。目前不对外开放乘客,投入34台Cybercab在市中心验证硬件可靠性。Cybercab为双座车型,完全围绕无人驾驶打造,无后期改装。此前奥斯汀已有无安全员Model Y无人驾驶出租于1月启用、6月22日开放付费服务。
国家网信办就《互联网信息服务管理办法》再次征求意见,首设“智能信息服务”专章规范AI服务
7月3日,国家互联网信息办公室就《互联网信息服务管理办法(修订草案征求意见稿)》再次公开征求意见。草案新增“智能信息服务”专章,要求AI服务提供者公示技术基本原理、训练数据来源,对生成合成内容进行标识,禁止强制用户使用智能服务或利用算法扰乱网络舆论。草案还强化用户账号管理,明确对超过6个月不登录账号可依约注销;要求平台建立网络暴力信息特征库,提供屏蔽、禁止转载等防护选项。意见反馈截止8月2日。
美国商务部批准OpenAI大规模发布GPT-5.6,Sol明日亮相
美国商务部正式批准OpenAI大规模发布GPT-5.6。OpenAI宣布GPT-5.6 Sol将于本周四完成最后准备后,与Terra和Luna一同面向公众推出。此前因国家安全考量,美国政府要求分阶段发布,仅允许向经批准的有限实体开放。此次全面放行标志着临时管控结束。获批前,美国商务部下属AI标准与创新中心执行了测试,OpenAI技术团队驻扎华盛顿配合沟通。美国最新AI行政令即将出台,旨在为先进AI模型发布建立正式评估框架。
研究:博科圣地已使用ChatGPT、Claude等主流AI聊天机器人用于袭击策划与武器开发
剑桥大学CASP研究员Antonia Jülich对27名前成员的57次访谈显示,博科圣地已使用ChatGPT、Claude、Gemini、Grok、Meta AI和DeepSeek等主流AI聊天机器人,用于袭击策划、制造更强爆炸装置、武器维护及行动安全。该组织两个派系均设立了专门的AI部门。ISIS自2023年起便提供提示工程和越狱培训,并训练尼日利亚的博科圣地指挥官绕过AI安全过滤器。研究指出,安全过滤器未能可靠防止滥用。Anthropic近期承认,越狱可能永远无法完全消除。
xAI 起诉 Grok 用户制作儿童性虐待内容,不再否认模型被滥用
xAI 首次对一名 Grok 用户提起诉讼,指控其利用该模型制作儿童性虐待图像(CSAM)。此前 xAI 一直否认 Grok 能生成此类内容,此次诉讼标志着其立场转变。案件聚焦用户滥用行为,而非模型本身的技术缺陷。
Anthropic 与作家群体15亿美元版权和解获批
美国旧金山联邦法官批准了Anthropic与作家群体达成的15亿美元(约101.67亿元人民币)版权和解协议,这是美国金额最大的版权赔偿案。此前法院裁定Anthropic对书籍进行AI训练属于合理使用,但保存超700万本盗版书籍侵犯了作者权利。Anthropic称超91%的受约束作者和出版商已领取赔偿。
数百用户向ChatGPT索要毒药与生物武器配方,部分获得高中生水平步骤指南
2025年夏季,OpenAI内部将GPT-5标记为高风险,因其可帮助教育程度有限的用户制造生物危害。据《华尔街日报》报道,自去年夏天以来,数百名用户向ChatGPT询问如何制造生物武器和毒药,部分用户获得了员工称高中生都能遵循的逐步指南。OpenAI暂停了相关账户,但未向当局报告任何事件。
RadixArk 与 Google Cloud 合作,将完整 SGLang 功能引入 TPU
RadixArk 与 Google Cloud 合作,将开源推理框架 SGLang 引入 Google TPU,开发者可通过 SGL-JAX 在最新 TPU 上运行 Gemma、Qwen、DeepSeek 等大语言模型及多模态模型。
论文研究
Research本月论文研究收录 8 个独立事件,重点包括“AI 用 prover-verifier LLM 循环攻克 9 个未解数学难题”、“NVIDIA 联合多所大学提出 ASPIRE:自我改进机器人框架,零样本成功率最高提升 77 分”。
AI 用 prover-verifier LLM 循环攻克 9 个未解数学难题
AI Safety Memes 推文指出,AI 刚刚解决了 9 个未解决的数学问题,但全球没有记者报道。引用 @WeinsteinOmri 的推文称,采用“prover-verifier”LLM 循环的方法,成功解决了理论计算机科学中 9 个重大开放问题,其中包括一个困扰其长达 2 年的难题。该研究由哥伦比亚大学合作者完成,并计划将这一方法扩展到所有科学领域。
NVIDIA 联合多所大学提出 ASPIRE:自我改进机器人框架,零样本成功率最高提升 77 分
NVIDIA 联合密歇根大学、UIUC、UC Berkeley 等提出 ASPIRE,一个持续学习机器人框架。它通过协调器-执行器架构、闭环执行引擎、技能库和进化搜索,编写并优化机器人控制程序。编程智能体使用 Claude Code(Claude Opus 4.6,1M token 上下文窗口)。在 LIBERO-Pro 上最高比最强基线提升 77 分;Robosuite 双手交接成功率从 20% 提升至 92%;BEHAVIOR-1K 收音机拾取任务从 56% 提升至 88%。利用 LIBERO-90 积累的技能,ASPIRE 在零样本条件下对 LIBERO-Pro Long 任务达到约 31% 成功率,此前方法饱和在 4% 附近…
面向AI模型双重用途知识的“开关”:Anthropic与AE Studio提出GRAM方法
Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后“遗忘”技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更鲁棒的方案。
Anthropic 研究:Claude 在不同模型与语言中的价值观表达
Anthropic 发布研究,通过构建“价值观轴”量化 Claude 表达的价值倾向。研究将 3,000 余种价值观压缩为四个关键轴:顺从 vs 谨慎、温暖 vs 严谨、深度 vs 简洁、坦诚 vs 执行。分析显示,Claude Opus 4.6 更倾向顺从、严谨、简洁和执行,而 Opus 4.7 更倾向谨慎、严谨、深度和坦诚;Sonnet 4.6 被认为更温暖。跨语言对比中,Claude 在阿拉伯语和印地语中更倾向温暖,在英语和俄语中更倾向严谨。该方法可帮助理解训练决策与文化背景对模型价值观的影响。
Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准
Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。
LVSum 基准:评估多模态大模型的长视频时间感知摘要能力
Apple 推出 LVSum,一个含细粒度时间对齐的人工标注长视频摘要基准,包含 13 个领域的 72 个视频(平均时长 16 分钟),每个视频配有最多 10 条含时间引用的人类摘要。评估显示,转录文本对摘要质量的贡献远大于视觉帧,当前多模态大模型在时间定位、指令遵循和跨模态一致性上存在系统性缺陷,与人类摘要仍有显著差距。
Apple 提出 LEAD 方法,破解长程推理中的“不可恢复瓶颈”
Apple 研究发现,大语言模型在长程执行中即使有高层策略也不稳定,极端分解会导致“不可恢复瓶颈”——少数“困难”步骤上的持续错误变得不可逆转。为此提出 Lookahead-Enhanced Atomic Decomposition(LEAD),通过引入短程未来验证与聚合来打破这一瓶颈。该方法在受控算法谜题上验证了有效性。
MoMo:通过时空动作分词实现机器人操作中的运动模式控制
机器人操作需根据任务、物体和交互环境调整动作执行方式。MoMo 提出两阶段模仿学习框架,包含时空动作分词器和行为克隆 Transformer,将任务与连续运动模式条件作为输入。在六项真实机器人操作任务中,改变该条件可稳定生成不同执行风格的动作。
技巧与观点
Daily本月技巧与观点收录 8 个独立事件,重点包括“一个人管理5款产品,80%时间不写代码?Every的复利工程”、“Fable 的判断力:Simon Willison 从 Claude Code 团队获得的效率技巧”。
一个人管理5款产品,80%时间不写代码?Every的复利工程
媒体软件公司Every公开「复利工程」方法论,以单人工程团队维护5款产品。核心是四步循环:Plan→Work→Review→Compound,其中Compound将每次解决问题的解法写入CLAUDE.md和docs/solutions/,使AI下次自动避坑。工程师80%时间花在Plan和Review,仅20%用于写代码。配套开源插件支持Claude Code等,含26个专项agent、23条工作流命令、13项技能,可零配置使用。/workflows:review一次并发14个agent审查代码,/workflows:plan在ultrathink模式下可并发40多个研究agent。
Fable 的判断力:Simon Willison 从 Claude Code 团队获得的效率技巧
Simon Willison 在 AIE 上与 Claude Code 团队交流后建议,让 Fable(以及 Opus)用自己的判断力工作,而非硬性规定行为。例如,直接让 Fable 自行决定何时编写测试,比给出具体规则更好。为应对价格即将上涨、节省 Fable token,Jesse Vincent 的另一个技巧是告诉 Fable 将较小任务委托给较低功耗模型(Sonnet 用于实质性实现、Haiku 用于机械修改),主循环保留判断、审计和数据合成等任务。Willison 已将提示词存入 Claude Code 记忆文件,实际效果良好,Fable token 消耗速度明显下降。
在校研究生Kunkun开源管理相互调用Skill的方法
在校研究生Kunkun开源了一套管理大量互相调用Skill的方法。核心方案包括:1)搭建HTML后台,按运行模式(手动/自动)、链路位置、专业领域三类标签筛选Skill;2)将连环调用的Skill绘制成Mermaid流程图,根据debug、新功能、合PR、改设计等阶段定位对应技能组;3)仿照Matt的ask Matt技能开发“ask me”技能,将调用决策浓缩成上下文喂给模型。该方法避免将所有调用交给模型自行判断,保持工程复杂场景下的人机对齐与可控性。项目已开源至GitHub。
前沿模型实际成本:tokenizer 差异导致隐性涨价
同一份 TypeScript 文件在 GPT-5.x 上为 681 个 token,在 Claude 最新 tokenizer 下为 1,178 个,相差 1.73 倍。Anthropic 新 tokenizer 比旧版多产生约 30% 的 token,标价不变,构成隐性涨价。Claude Opus 4.6 与 Opus 4.8 标价同为 $5.00 / $25.00,但新 tokenizer 使同一代码的 token 数增加约 32%。Claude Sonnet 5 的 $2.00 / $10.00 为促销价,2026 年 8 月 31 日后恢复 $3.00 / $15.00,届时相同代码成本将比 Sonnet 4.6 高出约 3…
OpenAI 强调青少年应获得安全 AI 访问权,推出 Study Mode 等保护措施
OpenAI 发文主张青少年应获得安全的 AI 访问权,并分享了针对 teen 用户的保护措施。目前每周有近 9 成 teen 用户使用 ChatGPT 进行学习、信息获取或技能提升。OpenAI 已推出 Study Mode(默认开启引导式学习而非直接给答案)、年龄预测、家长控制(可设置静音时段、关闭语音模式等)、以及针对暴力、自残、色情角色扮演等内容的安全护栏。
OpenRouter 新增音频转写 API,支持 Whisper 与 token 计价 STT 模型
OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。
OpenRouter 新增图像生成模型专用 API 端点
OpenRouter 通过专用 `/api/v1/images` 端点提供图像生成模型服务,图像理解仍通过 `/chat/completions` 端点完成,两者共用同一 API Key 和计费体系。该平台同时公布了两种任务的完整接口合约,并修复了此前出现的“no endpoints found”错误。
Skyscanner 如何用 Runway 消除前期制作中的猜测
Skyscanner 品牌团队在美加品牌广告拍摄中,使用 Runway 辅助艺术指导,在开拍前锁定镜头构图、灯光方向和演员站位,并在片场实时验证拍摄内容。团队将 Runway 生成的场景、道具和构图直接放入最终广告版式(OOH、Meta 广告等),将原本需要两周的构思过程压缩为可执行的预可视化方案,使拍摄现场反馈闭环从后期提前到实时。