周报
AI 行业本周重点进展
本周从 7 期日报中整理出 116 个独立事件,覆盖 5 个重点方向。
模型发布/更新
Model Releases本周模型发布/更新收录 6 个独立事件,重点包括“腾讯混元发布Hy3模型:295B参数MoE架构,Agent向LLM定位,已集成微信服务10亿+用户”、“Bonsai 27B:首款可在手机上运行的27B级多模态模型”。
腾讯混元发布Hy3模型:295B参数MoE架构,Agent向LLM定位,已集成微信服务10亿+用户
腾讯混元团队发布Hy3模型,采用295B总参数、21B激活参数的MoE架构,推理效率可打平参数规模2-5倍的旗舰模型。Hy3定位为Agent向LLM,从preview到正式版基于50多个真实业务反馈迭代,内部WorkBuddy任务成功率从72%提升至90%,耗时降低34%,幻觉和常识错误持续下降。实测显示其在coding、办公、复杂任务规划方面表现突出,纯视觉能力为短板。Hy3已集成至微信服务10亿+用户,视频演示包括生成HTML网页、Agent网页和10页PPT,模型具备自检和主动说明不足的能力。
Bonsai 27B:首款可在手机上运行的27B级多模态模型
Bonsai 27B 基于 Qwen3.6 27B,提供三元(1.71 有效比特/权重,5.9 GB)和 1-bit(1.125 有效比特/权重,3.9 GB)两个变体,后者首次将 27B 级模型装入 iPhone 17 Pro。模型支持多步推理、结构化工具调用、视觉任务和计算机使用智能体循环,拥有 262K token 上下文窗口,支持推测解码加速。在 15 项基准测试中,三元变体保留全精度基线 95% 的性能,1-bit 变体保留 90%,数学和编码能力几乎无损。采用 Apache 2.0 许可证开源。
腾讯混元 Hy3 量化版发布:1bit 版本单卡可部署,4bit 版本接近满血性能
腾讯混元团队为旗舰模型 Hy3(295B 参数)推出量化版本。1bit 版本(IQ1_M)将权重从 598 GB 压缩至 85.5 GiB,缩小 6.7 倍,单张 96GB 推理显卡即可部署;4bit 版本(Q4_K_M)体积 169.9 GiB,两张显卡可承载。量化版在 Agent、多语言代码、工具调用、长文理解等任务上表现接近满血模型。团队还提供 GPTQ Int4 版本,支持 vLLM 部署。配合 MTP 投机解码,1bit 版本解码速度提升约 50%,4bit 版本提升近 60%。所有版本已开源并打包为 GGUF 格式,适配 llama.cpp 生态。
Thinking Machines 发布多模态模型 Inkling
今天,我们推出 Inkling。 Inkling 能高效地对文本、图像和音频模态进行推理。我们将提供完整权重。 https://thinkingmachines.ai/news/introducing-inkling/ 即日起可在 Tinker 上进行微调。在 Inkling Playground 中试用。🧵
Kimi K3 发布:2.8T 参数开源模型,具备原生视觉与百万 token 上下文窗口
月之暗面发布 Kimi K3,一个 2.8T 参数的开源模型,采用 Kimi Delta Attention 和 Attention Residuals 架构,支持原生视觉能力与 100 万 token 上下文窗口。
通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms
通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
产品发布/更新
Products本周产品发布/更新收录 6 个独立事件,重点包括“Mesh LLM:在 iroh 上进行分布式人工智能计算”、“高德发布通用世界模型工坊 ABot-WorldStudio,已开放测试”。
Mesh LLM:在 iroh 上进行分布式人工智能计算
Mesh LLM 是一个开源项目,能将用户多台机器上的 GPU 和内存池化,对外暴露兼容 OpenAI 的 API。它通过 iroh 网络库实现点对点连接,无需中央服务器。请求可在本地 GPU 运行、路由到已加载模型的节点,或将大模型按层分区(内部称“Skippy”)流水线式拆分到多台机器。系统内置 40 多个模型,从 5 亿参数到 235B MoE 巨模型均可支持。软件体积约 18 MB,启动后以 `localhost:9337/v1` 提供服务。
高德发布通用世界模型工坊 ABot-WorldStudio,已开放测试
阿里巴巴旗下高德发布通用世界模型工坊 ABot-WorldStudio,并开放测试。该产品将交互式视频生成与 3DGS 场景生成统一,用户输入文字或图片即可生成可实时交互、可分享的 AI 世界。工坊内置“时空任意门”,穿越后可跃迁至另一完整 3D 世界。官方实测单次连续推理稳定运行超1小时,无崩溃、无质量衰减。底层模型 ABot-World0 与 ABot-3DWorld0 均可在单张 5090 上本地部署,已全面开源。
xAI 开源 Grok Build 编程智能体与终端界面
xAI 已将 Grok Build 的源代码在 GitHub 上开源。Grok Build 是 SpaceXAI 的编程智能体与终端用户界面(TUI),开源后用户可自行编译并完全本地运行,指向本地推理引擎并通过 `config.toml` 配置。
SGLang 与 Miles 为前沿多模态模型 Inkling 提供 Day-0 支持,推理吞吐达 71.7k tok/s
SGLang 与 Miles 为 Thinking Machines Lab 的 975B 参数多模态模型 Inkling 提供 Day-0 支持,其上下文窗口达 1M token。
秒哒 3.5 全球首发 iOS App,无代码开发与多端共享后端能力升级
百度智能云在 WAIC2026 发布秒哒 3.5,新增 iOS 打包能力,用户无需 Mac 或 Xcode 即可将应用打包为 IPA 文件或上架 App Store。3.5 版本还内置 SEO Agent 实现搜索优化自动化,支持多应用共享同一后端数据库,并推出数据库多环境隔离与后端资源分级功能。秒哒累计服务超 3500 万用户,已创造 350 万个商业应用。
Claude Code v2.1.214 发布:修复权限绕过、添加 EndConversation 工具与多项 Bash 权限检查改进
Claude Code v2.1.214 修复了 Windows PowerShell 5.1 中的权限检查绕过漏洞,以及 Bash 权限检查对超长命令(超过 10,000 字符)和 zsh 变量下标比较的误判问题。
行业动态
Industry本周行业动态收录 6 个独立事件,重点包括“苹果起诉OpenAI挖角窃密,分析师称即使指控未证实也可能重创其硬件计划”、“Hebbia 测试 Claude Fable 5:金融专用基准测试中准确率提升约 20%”。
苹果起诉OpenAI挖角窃密,分析师称即使指控未证实也可能重创其硬件计划
苹果在美国起诉OpenAI,指控其挖角400名员工、窃取工程机和机密文件。分析师Paolo Pescatore认为,即使指控最终无法证实,OpenAI的硬件计划仍可能受拖累,双方本就脆弱的合作关系将进一步削弱。斯坦福大学教授Mark Lemley指出,若前苹果员工确实带走机密文件并在OpenAI使用,问题将变得严重。该案涉及消费级硬件产品,预计未来将有更多信息曝光。
Hebbia 测试 Claude Fable 5:金融专用基准测试中准确率提升约 20%
为机构金融提供 AI 平台的 Hebbia 测试了 Claude Fable 5。在其金融专用基准测试中,Claude Fable 5 在文档问答与引证测试上实现了约 20% 的相对准确率提升,创下团队记录;在智能体测试中,它能同时处理多部分请求并逐一溯源。该模型还能从更广泛的数据中推理,得出值得深入分析的结论。Hebbia 正借助 Claude Fable 5 将 Matrix 平台的能力从提取信贷协议条款扩展到多步分析,如对比实时监控数据、标记风险并草拟内部备忘录。
Google 因 AI 训练再遭出版商集体诉讼
包括 Hachette、Cengage、Elsevier 及作家 Scott Turow 在内的出版商与作者团体对 Google 提起集体诉讼,指控其未经授权使用受版权保护的作品训练 Gemini 模型,并故意移除或篡改版权信息以掩盖这一行为。原告称 Google 将原本仅用于 Google Books 搜索片段展示的书籍副本,以及 Google Play 商店上传的图书,非法用于 AI 训练。诉讼援引 Google 内部文件,其中指出此举可能带来“100 亿至 1000 亿美元的潜在罚款”。该案在纽约南区联邦地区法院提起。
阿里Qwen将集成至Apple Intelligence服务中国用户
阿里巴巴的Qwen模型将被集成到Apple Intelligence中,为中国的iOS、iPadOS、macOS和visionOS用户提供文本与图像理解、内容生成等AI功能。中国网信办已公布包括Apple Intelligence、华为小艺大模型、OPPO AndesGPT在内的七项移动端生成式AI服务备案信息。阿里巴巴董事会主席蔡崇信表示,苹果在选定阿里前曾与多家中国公司洽谈。
世界人工智能合作组织协定签署仪式在上海举行,总部设中国上海
7月16日,成立世界人工智能合作组织协定签署仪式在上海举行,中共中央政治局委员、外交部长王毅代表中国政府签署协定。该组织是独立的政府间国际组织,总部设在中国上海,旨在促进人工智能国际合作与全球治理。哈萨克斯坦、老挝、巴基斯坦等29个国家代表签署协定成为创始成员国。
苹果与 OpenAI 法律战升级:约 40 名前员工收到苹果律师函
苹果已向约40名就职于OpenAI的前员工发出律师函,要求保存相关文件。此前苹果起诉OpenAI及两名前员工,指控其通过挖角获取商业机密以加速AI硬件研发。苹果称已有超400名前员工在OpenAI工作,正寻求法院禁令阻止OpenAI使用苹果信息并要求归还机密。
论文研究
Research本周论文研究收录 6 个独立事件,重点包括“OpenAI GPT-5.6 Sol Ultra 一小时证明 50 年图论猜想”、“Apple 等机构提出 Proactive Agent Research Environment (Pare),将应用建模为有限状态机以评估主动式智能体”。
OpenAI GPT-5.6 Sol Ultra 一小时证明 50 年图论猜想
OpenAI 宣布其 GPT-5.6 Sol Ultra 模型在不到一小时内生成了图论难题“循环双覆盖猜想”的完整证明。该猜想由数学家 George Szekeres 和 Paul Seymour 于 1970 年代提出,悬而未决超过 50 年。模型通过调用 64 个并行子智能体及对抗智能体,在预留的 8 小时计算时间内仅用约 1 小时完成证明。OpenAI 已将证明及提示词以 PDF 形式发布。该证明尚未经同行评审,也未使用 Lean 等形式化工具验证。若通过验证,这将是 LLM 首次独立解决维基百科“未解决数学问题”列表中的难题。
Apple 等机构提出 Proactive Agent Research Environment (Pare),将应用建模为有限状态机以评估主动式智能体
现有用户模拟框架将应用建模为扁平的工具调用 API,无法捕捉数字环境中用户交互的状态性和顺序性。Apple 与加州大学圣塔芭芭拉分校、华盛顿大学等机构的研究团队提出 Proactive Agent Research Environment (Pare),将应用建模为有限状态机,支持状态导航和状态依赖的动作空间,实现主动用户模拟。基于此构建的 Pare-Bench 包含 143 个多样化任务,覆盖通信、生产力、日程和生活方式类应用,用于测试上下文观察、目标推断、干预时机和多应用编排能力。
Apple 提出 LLM 函数调用不确定性量化方法
Apple 机器学习研究团队提出一种针对大语言模型函数调用的不确定性量化方法,旨在提升 LLM 在自主任务执行中的可靠性。该方法通过量化模型对函数调用参数和决策的置信度,帮助识别潜在错误调用。该研究目前处于学术探索阶段,未公布具体模型版本或开源计划。
Moonshot AI 发布 PerceptionBench:多模态模型视觉感知能力诊断基准
Moonshot AI 发布 PerceptionBench,一个从 40 多个现有基准中模型实际失败案例归纳出的视觉感知基准,包含 10 项原子感知能力和 3000 道验证题。所有测试模型准确率均未超过 60%,且大量正确答案在重复提问时无法复现,表明模型更多是猜测而非真正感知。PerceptionBench 旨在精确诊断多模态 AI 的视觉感知断裂点,推动其实现忠实、一致的视觉理解。
月之暗面在GTC 2026披露Kimi K2.5技术路线:用MuonClip、线性注意力与Agent Swarm重构三大基础组件
月之暗面CEO杨植麟在GTC 2026演讲中提出用MuonClip优化器替代Adam,可将数据利用效率提升近一倍。同时推出Kimi Linear线性注意力,在百万Token上下文下全面超越全注意力;Agent Swarm已支持300个Agent并行工作。
Apple 研究:Show Me Examples — 从图像集推断视觉概念
Apple 机器学习研究团队提出一种方法,让视觉语言模型(VLM)仅从图像集示例中推断视觉概念,无需文本指令。该方法通过对比示例图像与候选图像,使模型捕捉颜色、纹理等视觉规律,在多个概念推理基准上提升准确率。该研究目前为学术论文,未公布模型或 API 可用性。
技巧与观点
Daily本周技巧与观点收录 6 个独立事件,重点包括“纳德拉提出“反向信息悖论”:企业使用AI时需保护自身知识”、“Seedream 5.0 Pro 测评:图像编辑门槛爆降”。
纳德拉提出“反向信息悖论”:企业使用AI时需保护自身知识
微软CEO萨提亚·纳德拉提出“反向信息悖论”:AI时代,买家为使用AI支付金钱,同时必须暴露专有知识(提示词、工具使用、纠正反馈等),这些“智力废气”被模型学习,导致信息不对称向卖家倾斜。企业需要真正的信任边界,确保自身数据、痕迹、评估、适配权重和记忆在边界内积累,未经同意不得外泄。纳德拉呼吁企业拥有私有评估、保留组织记忆所有权,并主张企业应有权使用模型输出微调或训练自有模型,以控制自身学习循环。
Seedream 5.0 Pro 测评:图像编辑门槛爆降
字节跳动发布 Seedream 5.0 Pro,图像质量与提示词理解追平 GPT-Image 2.0,综合能力仅次于后者。核心亮点是“可编辑”交互:用户可在图上打点、画框、涂鸦,提示词中直接 @ 标记,实现精准局部编辑(如换沙发、改墙面颜色),其他区域不变。实测案例涵盖家装改造(一次替换六件家具)、商品图制作(键盘爆炸拆解图、标注卖点)、海报排版(框定位置生成文字)等场景,支持色卡配色和 SKU 换色。火山引擎已全量上线 API,即梦、豆包、Lumina 可体验。
唱作人 sad alex 谈如何用 Suno 作为创意草稿本,在短内容中保持创作自主性
洛杉矶唱作人 sad alex 分享她如何将 Suno 用作创意草稿本:解决人声转换、乐器采样或 demo 搭建等具体问题,且仅用于自己 100% 拥有版权的歌曲。她认为 AI 本质上是“向后看”的,而人类创作是“向前看”的,因此 Suno 不会取代作者的个人表达。面对紧迫截止日期或缺乏预算与合作者时,Suno 可以充当临时助手,帮助创作者更快完成制作、完善想法,从而获得更大的创作自主权。
企业AI智能体评估存在“现实对齐”缺口:半数组织曾将通过内部测试的智能体部署到生产环境后导致客户故障
对157家企业的调查显示,50%的组织在过去一年曾部署通过内部评估但导致客户故障的AI智能体或大语言模型功能,5%的企业完全信任自动化评估,29%认为评估与现实结果对齐不佳是最大局限。尽管信任度低,66%的企业已允许或正计划在12个月内实现低风险智能体的全自动、无人工干预部署。
OpenAI 强调青少年应获得安全 AI 访问权,推出 Study Mode 等保护措施
OpenAI 发文主张青少年应获得安全的 AI 访问权,并分享了针对 teen 用户的保护措施。目前每周有近 9 成 teen 用户使用 ChatGPT 进行学习、信息获取或技能提升。OpenAI 已推出 Study Mode(默认开启引导式学习而非直接给答案)、年龄预测、家长控制(可设置静音时段、关闭语音模式等)、以及针对暴力、自残、色情角色扮演等内容的安全护栏。
Index Ventures 联合创始人 Neil Rimer 认为 AI 财富将面临“再分配”
Index Ventures 联合创始人 Neil Rimer 表示,围绕 AI 积累的巨额财富将面临“某种形式的再分配”,无论是自愿还是强制。他呼吁科技领袖在推动自愿再分配中发挥主导作用。与此同时,美国慈善捐赠总额虽创新高,但捐赠人数持续下降,而加州正考虑对亿万富翁征收 5% 的一次性财富税。