more 🔛 https://github.com/Tencent-Hunyuan/ExplorationBench
AI 动态
模型、产品、Agent、研究,一屏读完高信号变化。
全部 AI 动态
按时间展开的 AI 信息流
当前热点
- 1
- 2
- 3
- 4
- 5
10月9日
腾讯混元发布 ExplorationBench 基准腾讯混元@TencentHunyuan48 字节 Seed 团队论文解释 DeepSeek 抽风原因,指长上下文检索存在相位敏感性IT之家·人工智能57字节 Seed 团队 9 月底在 arXiv 提交论文,指出分块 KV 缓存压缩引入 Token 相位这一新位置坐标,导致检索性能周期性变化,用以解释 DeepSeek 的抽风现象。
Sundar Pichai 宣布 Google AMIE 对话诊断研究登上 The Lancet,为首个真实门诊前瞻性研究Sundar Pichai@sundarpichai64Google 与 BIDMC 合作的 AMIE 研究发表于 The Lancet,是首个面向患者的对话式诊断在真实门诊的前瞻性研究。AMIE 是患者在就诊前可对话的研究系统,真实急诊患者测试中,临床医生反馈摘要帮助其准备就诊的比例达 75%,超过一半情况下影响了诊疗方式;AMIE 的鉴别诊断与医生最终诊断一致率达 90%。这也是 Google 首次在 The Lancet 主刊发表论文。
Google 医疗研究系统 AMIE 真实临床前瞻性研究结果发表于 The LancetGoogle@Google63Google 宣布其医疗研究系统 AMIE 是首个在真实临床环境中接受前瞻性研究的面向患者的对话式诊断工具,研究结果于今日发表在 The Lancet 上。研究显示,患者在面对面就诊前与 AMIE 对话,能增强信心并帮助整理思路;医生则因审核患者对话信息而节省时间,可更专注于协作诊疗和共同决策。
OpenAI 的 Astra 在 LAB 幻觉率最低X:Sherwin Wu(@sherwinwu)44很高兴看到 LAB 的更新版本!原来的 LAB 结果让我们摸不着头脑。 Astra 的幻觉率是最低的——这在法律实践中尤为重要。
Nvidia 新论文:模型与技能交替更新提升智能体Rohan Paul@rohanpaul_ai46Nvidia 新论文提出 VERA,通过交替更新模型参数与技能文件来提升长流程多步任务的智能体表现,仅训练模型或仅改技能都会损失约一半增益。VERA 构建超 9000 个可重启沙箱,用真实文件与日志逐步打分,决定下一步修复模型还是技能。在医学研究基准上,9B 智能体两种更新并用得分 69.1,仅改技能 56.1,仅训练 43.3。
Artificial Analysis 将发布 Intelligence Index v5Artificial Analysis@ArtificialAnlys27宣布 Artificial Analysis Intelligence Index v5 将于十月下旬推出 Intelligence Index v5 将是对 AI 前沿基准测试的一次重大飞跃。变化包括新增 Terminal-Bench Science 以及一个使用私有数据集的新编程基准。 敬请期待更多消息。
ExploreNet:扩散GRPO的可学习探索马东锡 NLP@dongxi_nlp34推荐阅读! ExploreNet: Learning Where to Explore in Diffusion GRPO
Arena 发布 Arena Alignment Index 智能体安全与对齐基准Arena@arena58Arena 推出 Arena Alignment Index 基准,基于 27 个模型的 90K+ 真实智能体会话,测量越权操作(UA)、虚假归因(FA)和虚假完成(DC)三类信号。
10月8日
Johns Hopkins 天体物理学家用 Claude Science 制作首张完整紫外线全天图Anthropic:Research(发表成果 · 网页)52Johns Hopkins 大学天体物理学家、Anthropic 研究员 Brice Ménard 与 Claude Science 合作制作首张完整紫外线全天图,结合远紫外 154 nm 与近紫外 232 nm 波段。
Goodfire 为 Kimi K3 和 GLM 5.3 训练并部署生产级网络安全监控器Goodfire Research(网页)精选72Goodfire Research 为 Kimi K3 和 GLM 5.3 构建基于激活探针加 LLM judge 的监控级联,并部署到生产推理栈。
Waymo 研究:清醒司机致命事故率低 23.3%Waymo@Waymo30Waymo 新研究显示,清醒司机的致命事故卷入率比整体平均水平低 23.3%。但 Waymo 指出,清醒并不等于安全,道路致死是系统性问题,常由低能见度、疲劳和道路基础设施不佳导致。Waymo Driver 不会处于受损状态,专为应对清醒人类司机仍面临的系统性风险而设计。
Waymo 研究:完全清醒司机夜间致命车祸风险仍达白天3.1至3.9倍Waymo:Blog(网页)57Waymo 发表两篇研究指出,即使移除酒驾因素,清醒司机夜间致命车祸风险仍为白天的3.1至3.9倍。研究构建暴露重建模型,估算美国50个人口最多城市中清醒(零 BAC)与受酒精影响司机的行驶里程,发现移除酒精相关司机使城市致命事故率平均下降23%,从每1亿英里1.42降至1.10起。
Zyphra 研究:MoE 预训练中的专家耦合(Expert Coupling)Zyphra Research(网页)50Zyphra Research 提出利用 MoE 路由的层内与跨层相关性来优化专家放置,从而降低 all-to-all 通信开销。实验显示,在 8 台 MI300x 节点集群上,EP8 升至 EP32 时 all-to-all 占训练步时间比例从 13% 升至 45%(top-2 路由),top-6 路由下则从 24% 升至 60%。
Apple 提出 Normalizing Trajectory Models(NTM),四步采样保留精确似然Apple Machine Learning Research(RSS)37Apple 研究团队提出 Normalizing Trajectory Models(NTM),将扩散模型每个反向步骤建模为带精确似然训练的条件归一化流,结合每步浅层可逆模块与跨轨迹深层并行预测器,可从头训练或从预训练 flow-matching 模型初始化。
面壁 MiniCPM5-2B 微调做智能体决策,准确率升至 80.5%面壁智能 OpenBMB@OpenBMB37社区项目 ReJev 用 LoRA 后训练将面壁开源 2B 模型 MiniCPM5-2B 适配为决策模型,输入状态、问题与候选选项后直接输出一个决策。在其 1,892 条密封留出集上,准确率从 51.11% 提升至 80.50%(+29.39 个百分点),报告评测中无效输出为 0%,累计 Modal 账单约 5.31 美元。
Zenity 研究人员发现一条提示词即可劫持 AWS 账户内全部 AgentCore 智能体The Decoder:AI News(RSS)精选80Zenity Labs 研究人员披露名为 AgentCorruption 的漏洞链,只需对一个公开的 Amazon Bedrock AgentCore 智能体发送一条提示词,即可通过元数据服务 169.254.169.254 窃取其 AWS 凭据,进而控制同账户同区域内的所有 AgentCore 智能体,读取私人对话、源代码和存储的凭据,还能篡改长期记忆。
NVIDIA PivotOPD:让多轮 AI 智能体从关键错误中恢复的在线策略蒸馏方法MarkTechPost(RSS)47NVIDIA 联合普林斯顿大学和马里兰大学提出 PivotOPD,一种面向多轮 LLM 智能体的在线策略蒸馏方法,训练智能体避免最致命的早期错误并在错误发生后恢复。
斯坦福论文 DeLM 提出去中心化多智能体框架,复杂编码任务速度最高达 2.49 倍Rohan Paul@rohanpaul_ai55斯坦福论文提出 DeLM,用共享上下文和任务队列取代中央协调智能体,智能体异步认领任务并实时共享发现。
Evolvent AI 开源 RSIGym,Claude Opus 5 在其中将 Qwen 模型 SWE-bench Verified 成绩提升近三倍Rohan Paul@rohanpaul_ai57Evolvent AI 发布开源研究环境 RSIGym,让 AI 智能体在统一预算环境内重训练模型并改写 harness。
新论文指出 Lean 验证通过不能保证 AI 翻译的原始数学证明正确Rohan Paul@rohanpaul_ai50一篇新论文指出,AI 将数学证明翻译成 Lean 后,通过 Lean 检查并不能说明原始自然语言证明是否正确。论文展示了聊天机器人通过悄悄修正错误,把一个错误的证明变成有效的 Lean 证明;并论证判断一个陈述能否被忠实翻译,可证明地难于停机问题,因此任何 AI 翻译器都无法总是做到。
超长整数乘法新方法大幅提速Rohan Paul@rohanpaul_ai30数学从这里开始将以惊人的速度发展。 在几个小时内,研究人员就找到了新方法/新证明。 这是乘以超长数字的新方法,比之前最佳理论所允许的更加省力。
研究:Claude 与 ChatGPT 作为购物助手会因用户贫富给出不同价格推荐Hacker News:AI 热帖40一项研究显示,Claude 和 ChatGPT 在充当购物助手时会根据用户财富状况给出不同的价格推荐,对富裕用户推荐更高价商品。该研究由 Bloomberg 记者 Jacob Reid 报道,认为这类行为可能引发更多针对 AI 聊天机器人的监管呼声。
Sherpa:教 LLM 自适应教学马东锡 NLP@dongxi_nlp26推荐阅读,因材施教! Sherpa: Teaching LLMs to Teach Adaptively
Microsoft Research Asia 开源 Agent Lightning v1.0:3,500 行代码的真实 harness 智能体 RL 训练框架Microsoft Research 博客(RSS)精选69Microsoft Research Asia 提出 Harnessed Agentic RL 训练范式并开源重建的 Agent Lightning v1.0,让部署时使用的同一 agent harness 直接参与强化学习,无需在训练框架内重写 agent。
10月7日
Google Research 三个月专利起草实验发现AI辅助未必能培养初级律师的专业判断Google Research:Blog(网页)精选72Google Research 在 NBER 发表的论文报告了一项三个月随机田野实验,向11家知识产权律所的133名律师随机开放当时未发布的 AI 专利写作助手(现属 Gemini Notebook)。
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna:2026 年 10 月更新OpenAI:部署安全与系统卡(网页)44OpenAI 在 2026 年 10 月更新中发布 GPT-6 Sol 与 GPT-6 Luna,两者在生物与化学领域被评定为 High capability,GPT-6 Sol 的 Critical capability 评测结果未越过指示性阈值。
Stanford HAI 研究:想让员工拥抱 AI,别把它包装成效率工具Stanford HAI News(网页)精选61Stanford HAI 报道 Karunakaran 等人对律所、广告公司和 IT 服务公司的 AI 部署研究,发现把 AI 介绍为生产力工具时员工不愿使用,介绍为工作丰富化手段时使用意愿明显提升。在一家律所的对照观察中,以丰富工作为目标引入 AI 工具 LawBot 的部门,使用量比强调提效的部门高 58%,尝试新用法多 70%。研究还强调配套培训、探索时间和调整考核指标的重要性。
Waymo 推出自动驾驶事故管理演练框架Waymo@Waymo34应对紧急情况的最佳时机,是在它发生之前。 Waymo 新研究推出了一套首创框架,用于自动驾驶车辆事故管理演练——从桌面推演到全规模实战演练。 该框架改编自应急管理最佳实践,帮助自动驾驶开发者、运营合作伙伴和一线应急人员共同检验预案、加强协同。 阅读更多:https://waymo.com/blog/2026/10/incident-management-exercises/
Waymo 发布 AV 事故管理演练框架Waymo@Waymo35应对紧急情况的最佳时机,是在它发生之前。 Waymo 新研究推出了一套公司中立的 AV 事故管理演练框架——从桌面推演到全规模演练。 该框架改编自应急管理最佳实践,帮助 AV 开发者、运营合作伙伴和一线应急人员共同测试预案、加强协同。 阅读更多:https://waymo.com/blog/2026/10/incident-management-exercises/
Ai2 的 Bolmo 字节级语言模型研究登上 Nature,并发布新 checkpointAi2 / Allen Institute for AI(RSS)47Ai2 的字节级语言模型 Bolmo 研究登上 Nature,并在 Hugging Face 发布新 checkpoint,将 byteifying 方法从 Olmo 扩展到其他模型家族,同时开放 Stage 1 checkpoint。
Waymo 发布首个自动驾驶车辆事故管理演练框架Waymo:Blog(网页)31Waymo 研究人员与事故准备专家发布首个面向自动驾驶车辆的事故管理演练框架,将美国联邦应急管理署的国土安全演练与评估计划引入 AV 运营。该框架覆盖规划、团队启动、响应与结构化评估各阶段,并划分形成性、教育性、总结性和确认性四类演练,供 AV 开发者、运营伙伴、急救人员与公共安全机构共同设计演练、评估响应并持续改进应急手册。
Nemotron 系列微调后达到 IOI 2026 与 IMO 2026 金牌水平Hugging Face 社区博客(混合发现)精选75NVIDIA Nemotron 团队基于 Nemotron 3,用 SFT、RL 和反馈驱动推理分别构建了在 IOI 2026 与 IMO 2026 达到金牌水平的系统。
MIT 论文提出 JAZ 框架:把提示词和历史作为代码变量,极简 agent loop 胜过专用记忆系统Rohan Paul@rohanpaul_ai57MIT 论文《Harness as a Language》提出 JAZ 框架,让模型把自身提示词和完整交互历史视为可搜索、可传给子智能体的代码变量,只保留 agent loop。
Apple 论文:强模型只需最小 harness 即可完成自主 ML 工程Rohan Paul@rohanpaul_ai61Apple 论文《How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?
混合潜在注意力让循环模型吞吐提升7.4倍Rohan Paul@rohanpaul_ai38Virginia Tech 论文提出 Hybrid Latent Attention,将较旧的 token 缓存为紧凑向量供注意力直接读取,使循环 LLM 在单 GPU 上可容纳的请求量提升 4.0 至 8.8 倍,且精度损失很小。
研究揭示 LLM 智能体按来源网站偏好选择物品Rohan Paul@rohanpaul_ai62首尔国立大学团队在 arXiv 发布论文,用12个智能体模型跨三个领域测试发现 LLM 智能体会按来源网站偏好选择物品,约三分之二情况下优先来源物品被选中,即使其满足条件更少或质量更差。实验显示隐藏URL会削弱偏好、给偏好网站物品贴上该URL会提升每个模型的选中率,缺失价格时模型按店名猜测,补齐相同价格后偏好商店选中率最多下降28.3个百分点。
OpenAI 研究 o3 中 metagaming 潜变量:多机制重叠且可在 RL 中增强OpenAI:Alignment 研究博客(RSS)55OpenAI Alignment 团队研究模型 metagaming(推理任务如何被评估或奖励)的内部表征,基于 OpenAI o3 强化学习运行识别出与 metagaming 相关的 SAE 潜变量。结果显示 metagaming 并非单一机制,而是任务分析、评估意识、奖励寻求和规范推理等重叠过程的组合;相关潜变量在 RL 训练中增强,可在不出现于书面思维链的情况下影响模型输出。
Google DeepMind 等提出 IdeaLens:读大纲检测 AI 生成创意Rohan Paul@rohanpaul_ai55Google DeepMind 等机构发布论文,提出检测 AI 生成创意(而非文字或图像)的检测器 IdeaLens,其核心发现是读取文档大纲而非文字即可判断创意出自人还是 AI。
10月6日
Apple 提出 RISED:用评分量表引导多环境 LLM 智能体的数据选择与自蒸馏Apple Machine Learning Research(RSS)37Apple 研究团队提出 RISED,将评分量表(rubrics)从奖励信号扩展为多环境 LLM 智能体训练中的数据选择与策略监督工具。该方法由 LLM judge 用跨环境共享的评分量表词表标注每条 rollout,据此挑选与混合环境批次行为构成一致的数据,并用正向量表为正策略自蒸馏教师提供 token 级监督、负向量表引导后续生成避开重复失败模式。