AI Signals · AI 动态

AI 动态

模型、产品、Agent、研究,一屏读完高信号变化。

Monthly Review558 条Asia/Shanghai
VOL.2026-06558 STORIESAI FOR SCIENCE MONTHLY

月报

2026年6月1日 - 2026年6月30日

MONTHLY · 月度观察

本期主线

AI 行业月度趋势观察

本月从 30 期日报中整理出 558 个独立事件,呈现 5 条持续演进的行业主线。

01

产品发布/更新

Product
8

本月产品发布/更新收录 8 个独立事件,重点包括“OpenAI发布生物防御AI工具Rosalind”、“Meet OpenJarvis:一个本地优先的设备端个人AI智能体框架,支持工具、记忆与学习”。

Claude 为 Connector 开发者推出性能监控仪表盘

Claude:Blog(网页)Claude:Blog(网页)

Claude 为目录中已发布的 Connector 新增性能监控仪表盘(公开测试版)。所有者可追踪活跃用户、工具调用次数、目录排名、健康评分、错误率、延迟,并按工具细分错误归因;还能按 Claude、Claude Code、Cowork 等产品分解使用情况。访问需 Team 或 Enterprise 账号(Admin/Owner 权限或自定义角色)。基于 MCP 构建的 Connector 可直接在 Claude 应用内提交至目录,该目录已有超 300 个第三方 Connector,每日被数百万人使用。

mlx-vlm v0.6.3 发布,Day-0 支持 Google DeepMind DiffusionGemma 和 Cohere North Mini Code 1.0

X:Berry Xia (@berryxia)X:Berry Xia (@berryxia)

mlx-vlm v0.6.3 上线,首发支持 DiffusionGemma 和 North Mini Code 1.0。DiffusionGemma 采用全新架构:以 256 token 块为单位并行生成、双向注意力、迭代自纠错;26B MoE 仅激活 3.8B,量化后 18GB 即可运行。North Mini Code 1.0 为 30B MoE,仅激活 3B,BF16 下约 66 tok/s。两款模型均通过深度合作实现 Day-0 MLX 支持,可在 Mac 本地运行。可通过 `uv pip install -U mlx-vlm` 安装体验。

教育部“阳光志愿”信息服务系统全新升级上线:智能筛选志愿,数据权威可信

IT之家(RSS)IT之家(RSS)

教育部“阳光志愿”信息服务系统今日全新升级上线,依托招生、学籍、就业等海量官方数据,免费为考生和家长提供志愿填报服务。系统支持31个省区市本专科普通批次志愿筛选,输入高考成绩、位次及个性化条件即可快速生成合理参考方案。AI助手“智慧小招”24小时在线解答政策规则。平台数据由高校直接报送、官方核验,真实可靠。同时推出专业倾向测评和21项生涯测评工具,帮助学生认清特长、规划未来。

火山引擎推出Agent Ready基础设施,AgentKit与ArkClaw企业版升级

公众号·官方公众号:火山引擎

火山引擎在FORCE大会推出面向企业智能应用的Agent Ready基础设施,构建AI云与Agent三层架构。AgentKit升级提供Identity、Runtime、Sandbox、Evaluation等模块,实现Agent可靠、可控、可衡量。Identity已接入数千家身份体系,Runtime支持长程任务和分钟级12万沙箱并发。ArkClaw企业版集成Agent广场、技能中心与企业知识库,支持IDP/SSO/OAuth及飞书、钉钉等IM入口统一管控。实践案例:海底捞门店经营Agent将小时级工作压缩到分钟级,人工跟进时长缩减70%,巡检满意度提升50%;创维酷开借助ArkClaw终端版打造AIOS,Token消耗节省50%,支撑…

Claude Code v2.1.196 发布

Claude Code:GitHub Releases(RSS)Claude Code:GitHub Releases(RSS)

新增组织默认模型支持,未选模型时显示“Org default”。聊天会话可读默认名称,文件附件支持 Cmd/Ctrl-click 定位。安全方面,`claude mcp list/get` 不再启动通过 `.claude/settings.json` 自批准的不安全服务器;不受信任工作区显示“Pending approval”。`/code-review` 合并五个清理查找器,token 用量减少约 25%。终端 UI 跳过空子树遍历减少渲染。流式空闲看门狗默认开启,5 分钟无事件自动中止重试。修复背景对话误删、远程会话自动恢复、MCP OAuth 作用域冲突、Agents 侧边栏焦点丢失等多项问题。

02

行业动态

Industry
8

本月行业动态收录 8 个独立事件,重点包括“OpenAI正式进军机器人领域并启动招聘”、“Cloudflare Radar:机器人流量首次超过人类占比57.5%”。

OpenAI正式进军机器人领域并启动招聘

X·KOLX:Sam Altman (@sama)

OpenAI宣布成立OpenAI Robotics团队,并开始招聘全栈硬件、系统及ML工程师,以编程和制造能服务社会的机器人。该项目由Aditya Ramesh领导,其世界模拟研究计划已演变为机器人研究,强调硬件与ML研究的协同设计。短期目标是支持技术工人构建未来基础设施,长期愿景是为每个人提供个人机器人。

Cloudflare Radar:机器人流量首次超过人类占比57.5%

X·KOLX:小互 (@xiaohu)

Cloudflare Radar 实时统计显示,过去一周(5月28日至6月4日)全球所有 HTML 网页请求流量中,57.5% 来自机器人(爬虫、AI 抓取、自动化脚本),仅42.5%来自真人浏览器,机器人流量首次超过人类。按所有 HTTP 流量返回内容分类,JSON(API 机器通信)占33.1%居首,HTML 仅12%。互联网流量主体已从人类浏览网页转向机器间通信和机器人抓取。

苹果 WWDC 2026 直播

Hacker News 热门(buzzing.cc 中文翻译)Hacker News 热门(buzzing.cc 中文翻译)

苹果 WWDC 2026 主题演讲通过官网进行直播,Hacker News 用户讨论热度达到 110 点。

全自主无人机首次击毙了人类士兵

Hacker News 热门(buzzing.cc 中文翻译)Hacker News 热门(buzzing.cc 中文翻译)

据《新科学家》6月10日报道,全自主无人机首次击毙了人类士兵。这是有记录以来第一次由完全自主运行的无人机执行致命攻击,标志着自主武器系统在实战中的新进展。该报道来自《新科学家》网站,目前尚无更多细节公布。

Cloudflare 引入 Ensemble AI 团队,加速 AI 基础设施研发

Cloudflare BlogCloudflare Blog

Cloudflare 宣布 Ensemble AI 团队关键成员加入,以加速 AI 基础设施研发。Ensemble 专注于模型压缩与高效推理,开发了 NdLinear(可直接替换 Transformer 标准线性层并保持多维激活结构)和 NdLinear-LoRA(降低大模型微调所需可训练参数)。这些技术与量化等方法互补,旨在降低大语言模型和多模态架构的内存、计算与部署开销。Cloudflare 将把 Ensemble 的成果整合到 Workers AI 平台,通过全球网络与 serverless GPU 推理服务,进一步提升推理效率、GPU 利用率和部署经济性。

Noam Shazeer 离开 Google 加入 OpenAI

X:Yuchen Jin (@Yuchenj_UW)X:Yuchen Jin (@Yuchenj_UW)

两年前谷歌花 27 亿美元请回的 AI 传奇 Noam Shazeer 已离开谷歌,加入 OpenAI。 对 Gemini 来说是个残酷的消息。

Omio 如何构建对话式旅行的未来

OpenAI:官网动态(RSS · 排除企业/客户案例)OpenAI:官网动态(RSS · 排除企业/客户案例)

Omio 利用 OpenAI 技术打造对话式旅行体验,加速产品开发进程,并推动自身向 AI 原生公司转型。

SK 集团会长崔泰源:到 2035 年建设 15GW AI 数据中心,总投资达 1000 万亿韩元

IT之家(RSS)IT之家(RSS)

SK 集团会长崔泰源 6 月 29 日宣布,计划到 2035 年建成 15GW AI 数据中心容量,作为韩国国家级基础设施和实体 AI 时代核心底座。项目总投资 1000 万亿韩元(约 4.4 万亿元人民币),未来 10 年保持年均 100 万亿韩元以上国内投资,旨在实现从出口传统商品向智能服务的转变,构建韩国智能市场。此外,SK 海力士将向韩国西南部投资 400 万亿韩元,半导体供应项目总投资达 1100 万亿韩元(约 4.84 万亿元人民币)。

03

技巧与观点

Tips & Takes
8

本月技巧与观点收录 8 个独立事件,重点包括“我花200英镑把一台数据中心级GPU装进了我的游戏电脑”、“OpenRouter 翻遍 11 款 LLM 找最快的决策模型:Claude vs. Grok 领衔”。

我花200英镑把一台数据中心级GPU装进了我的游戏电脑

综合资讯Hacker News 热门(buzzing.cc 中文翻译)

一名用户以200英镑的价格购入了一块数据中心级GPU,并将其成功安装到自己的游戏电脑中。文章记述了这一非标准硬件改装过程、遇到的技术挑战以及最终实现本地运行大语言模型的体验。

OpenRouter 翻遍 11 款 LLM 找最快的决策模型:Claude vs. Grok 领衔

官方OpenRouter:Announcements(RSS)

OpenRouter 用总价 482 美元的推理花费,让 11 款大语言模型在 30 轮实时决策的“大逃杀”挑战中正面竞争。实验结果表明,传统的静态 benchmark 排名无法反映模型在需要即时反应的智能体任务(如自主控制机器人)中的真实表现,Claude 和 Grok 系列模型在决策速度与任务成功率上表现突出,而多项高分模型的实时调度能力未达预期。

Hivemind推出面向AI编程智能体的持续学习功能,即日起开放

X:Kim (@kimmonismus)X:Kim (@kimmonismus)

Hivemind发布面向AI编程智能体的持续学习功能,即日起开放。该工具收集团队运行的每个智能体(Claude Code、Codex、Cursor、Hermes、Pi)的轨迹,转化为可复用技能并推送到所有智能体,数据存储在用户自己的云存储中。内置SkillOpt使技能持续训练:Claude Code准确率提升+19.1分,Codex提升+24.8分,在全部52个测试设置中最佳或持平。开源,一行命令安装。

AI 应用黄金时代已至:Fable 被禁、Nadella 的护城河论点与 Salesforce 收购 Fin

Tomer Tunguz 博客(VC 分析)Tomer Tunguz 博客(VC 分析)

美国政府关闭 Anthropic 的 Fable 访问,开源和本地模型成必备;Satya Nadella 主张 AI 生态护城河应是人类专业知识和模型外围系统;Salesforce 以 36 亿美元收购 Fin(前 Intercom),Fin 利用开源模型实现性价比。这三件事标志 AI 应用进入黄金时代。构建 AI 应用的难点:在 Kimi K2.6、Qwen 3.6 27b、GLM 5.1 等不同特性模型中选择;设计智能体系统的 hill-climbing 循环;持续评估模型+循环性能以最大化 token 预算中的智能。掌握这三项技能的公司将主导这一时代。

baoyu-design Skill迭代:修复导出样式与渐变丢失问题,支持AI配图导出PPTX

X·KOLX:宝玉 (@dotey)

宝玉分享 baoyu-design Skill 的迭代过程:用户测试发现导出问题(样式表未铺满整页、渐变色丢失),他在本地复现后让 Agent 分析原因、给出解决方案并添加测试覆盖,修复后效果改善。该 Skill 可在制作 PPT、动画视频或网站时调用 AI 生图配图,支持 Codex 内置画图或配合 baoyu-image-gen Skill 调用 Codex CLI 画图,并能连同图片一起导出为 PPTX,在 PowerPoint/Keynote 中二次编辑。迭代循环:自己用 → 发现问题 → 让 Agent 分析 → 出方案 → 确认 → 更新 Skill。

OpenRouter 零数据留存(ZDR)实践:97 款新模型,流量占比近半

官方OpenRouter:Announcements(RSS)

OpenRouter 的零数据留存(ZDR)保证用户提示词和模型响应不被存储,元数据一般安全。自 1 月以来新增 97 款支持 ZDR 的模型,月度 token 量增长 4.3 倍,约占全部路由流量一半。ZDR 在三个层面执行:账户级(整个供应商开启)、护栏级(按 API Key 或组织成员限定)、单次请求级(传参数仅路由至 ZDR 端点)。企业用户可灵活选择控制粒度,避免锁定单一供应商。

Anthropic:当AI成本超过工程师薪酬

Tomer Tunguz 博客(VC 分析)Tomer Tunguz 博客(VC 分析)

Anthropic在算力上的支出达到每位工程师每年51.5万美元,是其完全薪资(22.4万美元)的2.3倍。相比之下,顶尖1%软件公司的算力支出为8.9万美元,中位数仅为1.37万美元。三个2029年情景预测了这一差距的缩小路径。

04

模型发布/更新

Model Releases
8

本月模型发布/更新收录 8 个独立事件,重点包括“MiniMax M3:前沿编码、100万token上下文与原生多模态一体模型”、“阶跃星辰Step 3.7 Flash发布,专为高效推理设计”。

MiniMax M3:前沿编码、100万token上下文与原生多模态一体模型

官方MiniMax:Blog(网页)

MiniMax M3 是一个开源前沿模型,具备先进的编码与AI智能体能力。它支持100万token的超长上下文窗口,并采用名为MSA(MiniMax Sparse Attention)的新型稀疏注意力架构。该架构使模型在100万token上下文下的每token计算成本降至前代的1/20,预填充速度提升9倍以上,解码速度提升15倍以上。在SWE-Bench Pro编码基准上,MiniMax M3得分59.0%,超越GPT-5.5和Gemini 3.1 Pro,性能接近Opus 4.7。该模型可通过MiniMax Code、Token Plan和API服务使用。

阶跃星辰Step 3.7 Flash发布,专为高效推理设计

官方·XX:阶跃星辰 StepFun (@StepFun_ai)

阶跃星辰发布其推理优化型模型Step 3.7 Flash。该模型为196B MoE架构,从设计之初就专注于推理效率。其采用多矩阵分解注意力机制,使KV-cache成本仅为DeepSeek模型的约22%;同时通过注意力与FFN解耦技术,实现了硬件优化的高效服务。该模型已通过Fireworks AI提供,采用Apache 2.0许可,并可用于构建智能体应用。

Harness-1:基于强化学习训练的有状态搜索20B检索子智能体

综合资讯MarkTechPost(RSS)

UIUC与Chroma联合推出Harness-1,一个20B参数的检索子智能体。它通过强化学习在一个有状态搜索框架中训练,该框架维护候选池、重要性标注集、证据图和验证记录,由策略决定搜索、筛选、验证及停止的时机。Harness-1在8个基准测试上达到0.730平均curated recall,比下一个最佳开源子智能体高出11.4个百分点,仅落后于Opus-4.6。模型权重和框架代码均已公开。

Cohere发布North Mini Code:面向开发者的开源编码模型

Hugging Face:Blog(RSS)Hugging Face:Blog(RSS)

Cohere发布North Mini Code,一款30B参数MoE模型(3B活跃参数),Apache 2.0开源。在Artificial Analysis Coding Index上得分33.4,超越Qwen3.5、Gemma 4等同类模型。后训练采用两阶段SFT和RLVR,在SWE-Bench Verified上pass@10达80.2%,Terminal-Bench v2上达55.1%。支持64K/128K上下文长度,专为智能体编码任务优化。

MiniMax 开源 M3 模型权重及 MSA 技术论文

公众号:MiniMax(稀宇科技)公众号:MiniMax(稀宇科技)

MiniMax 上周五开源了 428B 总参数、23B 激活参数的 M3 模型权重,同步发布 MSA(MiniMax Sparse Attention)技术论文,该架构显著降低长上下文计算成本。M3 是首个从预训练阶段就进行文本、图像等多模态交错混合训练的开源模型。发布两周后,M3 在 Artificial Analysis 综合智能指数、GDPval-AA 排行榜均获开源模型第一,Code Arena WebDev 跻身帕累托最优序列,Vals.AI 榜单居国产模型首位。输出速度已从约 30 TPS 提升至约 80 TPS,计划再提速 30–40%;Token Plan 后台新增调用量看板。

首个统一科学大模型 LOGOS 正式开源

公众号:通义实验室(千问)公众号:通义实验室(千问)

LOGOS 由 ATH-Token Foundry 联合中国人民大学高瓴人工智能学院开源,是首个基于统一“科学语法”的多领域科学生成基础模型。LOGOS-1B(1B参数)在六大科学任务上匹配或超越领域专用方法:口袋条件配体生成纯序列范式首次超越3D扩散模型,超越NatureLM(8×7B);逆合成预测Top-1准确率74.8%;口袋位点识别仅靠序列达58.5% Top-n准确率;MOF材料生成NBB提升至17.78%。模型采用统一词汇表将蛋白质、小分子等编码为离散Token,通过空间交互离散化实现无需3D坐标的序列预测。预训练与下游任务形式与目标一致,跨领域知识迁移经实验验证有效。已完整开源模型权重、推理代码与技术报告。

Seed2.1 正式发布,深入 AI 生产力

字节 Seed:Research Feed(网页内嵌数据)字节 Seed:Research Feed(网页内嵌数据)

字节Seed发布Seed2.1系列,面向真实生产力场景的智能体,强化通用Agent能力、代码工程交付与多模态理解。Seed2.1 Pro在GDPval基准获最高分,Agents' Last Exam位列参评模型第一梯队;MobileWorld手机GUI任务最高分,CreativeWork多环境任务表现突出。多模态在CharXiv-RQ等多项基准取得SOTA。代码能力上,Seed2.1 Pro在NL2Repo-Bench表现良好,开发者评测相比Claude Opus 4.6获59.1%胜率。模型已在豆包、TRAE上线,API通过火山方舟提供。

美团LongCat Owl Alpha:OpenRouter最流行模型,1.6万亿MoE,国产ASIC训练

X:Emad Mostaque (@EMostaque)X:Emad Mostaque (@EMostaque)

美团LongCat的1.6万亿参数MoE模型Owl Alpha成为OpenRouter上最流行模型,累计消耗10万亿tokens,性能达Gemini/Opus 4.6级别。该模型使用35万亿tokens训练,完全在5万块国产ASIC上完成。据官方推文,Owl Alpha上线后每日调用量全球Top3,在Hermes Agent排名#1,Claude Code排名#2,OpenClaw排名#3。该模型即将退役,后续版本待公布。

05

论文研究

Research
8

本月论文研究收录 8 个独立事件,重点包括“微软研究:Aurora天气预报速度超传统超算数千倍”、“Nemotron 预训练的任务种子合成问答生成”。

Nemotron 预训练的任务种子合成问答生成

官方Hugging Face:Blog(RSS)

在 Nemotron-3 Nano 模型的 100B token 续训练实验中,任务种子合成数据生成(Task-Seeded SDG)使 MMLU-Pro 提升 1.8 分,平均代码提升 1.9 分,常识理解提升 1.6 分,GPQA 提升 11.1 分,数学成绩保持稳定。该流程利用 lm-eval-harness 中约 70 个公开任务(约 700 子任务)的训练集作为种子,生成新示例并补充推理和上下文,经过格式校验、去重和答案验证后得到精选合成数据集,用于 Nemotron Ultra 和 Super 训练。

为生物学AI智能体铺路

Anthropic:Research(发表成果 · 网页)Anthropic:Research(发表成果 · 网页)

一项实验让Claude、Biomni、Edison Analysis、GPT等科研智能体从病毒学数据库NCBI Virus中检索序列数据,即使最强模型也无法稳定达到可靠数据集构建所需的准确率。加入确定性检索层gget virus后,准确率接近100%。研究指出,当前生物学数据基础设施存在碎片化、格式特殊、接口不统一等问题,导致AI智能体难以像在软件领域那样高效工作。确定性检索工具是实现可靠智能体工作流的关键,生物学数据库需为智能体作为规模化用户而设计。

Anthropic:智能体编码中专业知识回报持续存在

Anthropic:Research(发表成果 · 网页)Anthropic:Research(发表成果 · 网页)

Anthropic 基于约40万次 Claude Code 交互会话(2025年10月至2026年4月)分析发现:人类主导规划决策(做什么),Claude 主导执行决策(怎么做)。领域专业知识越强,模型每次指令完成的工作量越多。各类职业完成任务的成功率与软件工程师平均相近;领域专家成功率更高,但与中级用户差距不大。七个月间调试会话占比下降近一半,使用转向端到端智能体任务(部署运行代码、分析数据、编写非代码文档),典型任务价值平均上升约25%。

OpenAI 与 Molecule.one 合作:GPT‑5.4 自主优化 Chan‑Lam 偶联反应

OpenAI:官网动态(RSS · 排除企业/客户案例)OpenAI:官网动态(RSS · 排除企业/客户案例)

OpenAI 将 GPT‑5.4 接入 Molecule.one 的自主化学智能体 Maria,用于优化药物化学中的 Chan‑Lam 偶联反应。GPT‑5.4 独立识别伯磺酰胺为高价值挑战性底物,并建议使用 TEMPO 等温和氧化剂。经两轮实验,88% 的硼酸和 83% 的磺酰胺底物产率提升,平均产率从 16.6% 升至 25.2%,产率超 30% 的反应占比从 15.6% 增至 37.5%。人类化学家后续验证,14 对底物中 11 对产率提高,多数提升超两倍。

九位评委,两个有效投票:相关错误削弱LLM评审面板

Apple Machine Learning Research(RSS)Apple Machine Learning Research(RSS)

苹果机器学习研究团队发现,LLM-as-a-judge面板因模型间高度相关而严重受限。对7个模型家族的9个前沿大语言模型在3个自然语言推理数据集上的测试表明,9位评委实际仅提供约2个独立投票的信息量,面板准确率比独立投票理想值低8–22个百分点,最佳单一模型的表现已匹敌或超越整个面板。增加评委数量或改进聚合算法收效甚微,即使允许算法获取正确答案也仅能缩小至多11%的差距。该结论在多种提示变体、温度设置及偏好任务中均得到验证,瓶颈在于评委间的相关性而非聚合算法。

用线性弹性缓存优化云经济

Google Research:Blog(网页)Google Research:Blog(网页)

Google Research 与 Google Cloud 提出线性弹性缓存,将缓存管理转为线性成本优化问题,动态调整大小以最小化总拥有成本。为每条数据引入“滑雪租赁”决策框架,在租用内存(持续付费)与购买缺失(缓存未命中惩罚)间选择,并用轻量级机器学习实时优化内存占用与缺失率权衡。无服务器云场景下(每 GiB 内存每天 $3),该技术可在不牺牲性能的同时显著降本。论文发表于 CIDR。

DiScoFormer:一个跨分布同时估计密度与分数的单一Transformer模型

Hugging Face:Blog(RSS)Hugging Face:Blog(RSS)

DiScoFormer(Density and Score Transformer)是一个无需重新训练即可从数据点估计分布密度和分数的单一模型。它利用Transformer的交叉注意力机制,在单次前向传播中输出密度和分数,并通过一致性损失实现分布外自适应。在100维空间中,DiScoFormer比最优调参的核密度估计(KDE)降低分数误差约6.5倍、密度误差超过37倍,且随样本量增加持续提升,而KDE内存耗尽。模型基于高斯混合模型训练,可泛化至非高斯分布(如Laplace、Student-t)及未见过的多模态混合。

558
独立事件
132
信源
30
日报浓缩
17min
阅读时长
AI for Science · 多日报聚合