more 🔛 https://github.com/Tencent-Hunyuan/ExplorationBench
AI 动态
模型、产品、Agent、研究,一屏读完高信号变化。
全部 AI 动态
按时间展开的 AI 信息流
当前热点
- 1
- 2
- 3
- 4
- 5
10月9日
腾讯混元发布 ExplorationBench 基准腾讯混元@TencentHunyuan48 Sundar Pichai 宣布 Google AMIE 对话诊断研究登上 The Lancet,为首个真实门诊前瞻性研究Sundar Pichai@sundarpichai64Google 与 BIDMC 合作的 AMIE 研究发表于 The Lancet,是首个面向患者的对话式诊断在真实门诊的前瞻性研究。AMIE 是患者在就诊前可对话的研究系统,真实急诊患者测试中,临床医生反馈摘要帮助其准备就诊的比例达 75%,超过一半情况下影响了诊疗方式;AMIE 的鉴别诊断与医生最终诊断一致率达 90%。这也是 Google 首次在 The Lancet 主刊发表论文。
Google 医疗研究系统 AMIE 真实临床前瞻性研究结果发表于 The LancetGoogle@Google63Google 宣布其医疗研究系统 AMIE 是首个在真实临床环境中接受前瞻性研究的面向患者的对话式诊断工具,研究结果于今日发表在 The Lancet 上。研究显示,患者在面对面就诊前与 AMIE 对话,能增强信心并帮助整理思路;医生则因审核患者对话信息而节省时间,可更专注于协作诊疗和共同决策。
OpenAI 的 Astra 在 LAB 幻觉率最低X:Sherwin Wu(@sherwinwu)44很高兴看到 LAB 的更新版本!原来的 LAB 结果让我们摸不着头脑。 Astra 的幻觉率是最低的——这在法律实践中尤为重要。
Nvidia 新论文:模型与技能交替更新提升智能体Rohan Paul@rohanpaul_ai46Nvidia 新论文提出 VERA,通过交替更新模型参数与技能文件来提升长流程多步任务的智能体表现,仅训练模型或仅改技能都会损失约一半增益。VERA 构建超 9000 个可重启沙箱,用真实文件与日志逐步打分,决定下一步修复模型还是技能。在医学研究基准上,9B 智能体两种更新并用得分 69.1,仅改技能 56.1,仅训练 43.3。
Artificial Analysis 将发布 Intelligence Index v5Artificial Analysis@ArtificialAnlys27宣布 Artificial Analysis Intelligence Index v5 将于十月下旬推出 Intelligence Index v5 将是对 AI 前沿基准测试的一次重大飞跃。变化包括新增 Terminal-Bench Science 以及一个使用私有数据集的新编程基准。 敬请期待更多消息。
ExploreNet:扩散GRPO的可学习探索马东锡 NLP@dongxi_nlp34推荐阅读! ExploreNet: Learning Where to Explore in Diffusion GRPO
Arena 发布 Arena Alignment Index 智能体安全与对齐基准Arena@arena58Arena 推出 Arena Alignment Index 基准,基于 27 个模型的 90K+ 真实智能体会话,测量越权操作(UA)、虚假归因(FA)和虚假完成(DC)三类信号。
10月8日
Waymo 研究:清醒司机致命事故率低 23.3%Waymo@Waymo30Waymo 新研究显示,清醒司机的致命事故卷入率比整体平均水平低 23.3%。但 Waymo 指出,清醒并不等于安全,道路致死是系统性问题,常由低能见度、疲劳和道路基础设施不佳导致。Waymo Driver 不会处于受损状态,专为应对清醒人类司机仍面临的系统性风险而设计。
面壁 MiniCPM5-2B 微调做智能体决策,准确率升至 80.5%面壁智能 OpenBMB@OpenBMB37社区项目 ReJev 用 LoRA 后训练将面壁开源 2B 模型 MiniCPM5-2B 适配为决策模型,输入状态、问题与候选选项后直接输出一个决策。在其 1,892 条密封留出集上,准确率从 51.11% 提升至 80.50%(+29.39 个百分点),报告评测中无效输出为 0%,累计 Modal 账单约 5.31 美元。
斯坦福论文 DeLM 提出去中心化多智能体框架,复杂编码任务速度最高达 2.49 倍Rohan Paul@rohanpaul_ai55斯坦福论文提出 DeLM,用共享上下文和任务队列取代中央协调智能体,智能体异步认领任务并实时共享发现。
Evolvent AI 开源 RSIGym,Claude Opus 5 在其中将 Qwen 模型 SWE-bench Verified 成绩提升近三倍Rohan Paul@rohanpaul_ai57Evolvent AI 发布开源研究环境 RSIGym,让 AI 智能体在统一预算环境内重训练模型并改写 harness。
新论文指出 Lean 验证通过不能保证 AI 翻译的原始数学证明正确Rohan Paul@rohanpaul_ai50一篇新论文指出,AI 将数学证明翻译成 Lean 后,通过 Lean 检查并不能说明原始自然语言证明是否正确。论文展示了聊天机器人通过悄悄修正错误,把一个错误的证明变成有效的 Lean 证明;并论证判断一个陈述能否被忠实翻译,可证明地难于停机问题,因此任何 AI 翻译器都无法总是做到。
超长整数乘法新方法大幅提速Rohan Paul@rohanpaul_ai30数学从这里开始将以惊人的速度发展。 在几个小时内,研究人员就找到了新方法/新证明。 这是乘以超长数字的新方法,比之前最佳理论所允许的更加省力。
Sherpa:教 LLM 自适应教学马东锡 NLP@dongxi_nlp26推荐阅读,因材施教! Sherpa: Teaching LLMs to Teach Adaptively
10月7日
Waymo 推出自动驾驶事故管理演练框架Waymo@Waymo34应对紧急情况的最佳时机,是在它发生之前。 Waymo 新研究推出了一套首创框架,用于自动驾驶车辆事故管理演练——从桌面推演到全规模实战演练。 该框架改编自应急管理最佳实践,帮助自动驾驶开发者、运营合作伙伴和一线应急人员共同检验预案、加强协同。 阅读更多:https://waymo.com/blog/2026/10/incident-management-exercises/
Waymo 发布 AV 事故管理演练框架Waymo@Waymo35应对紧急情况的最佳时机,是在它发生之前。 Waymo 新研究推出了一套公司中立的 AV 事故管理演练框架——从桌面推演到全规模演练。 该框架改编自应急管理最佳实践,帮助 AV 开发者、运营合作伙伴和一线应急人员共同测试预案、加强协同。 阅读更多:https://waymo.com/blog/2026/10/incident-management-exercises/
MIT 论文提出 JAZ 框架:把提示词和历史作为代码变量,极简 agent loop 胜过专用记忆系统Rohan Paul@rohanpaul_ai57MIT 论文《Harness as a Language》提出 JAZ 框架,让模型把自身提示词和完整交互历史视为可搜索、可传给子智能体的代码变量,只保留 agent loop。
Apple 论文:强模型只需最小 harness 即可完成自主 ML 工程Rohan Paul@rohanpaul_ai61Apple 论文《How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?
混合潜在注意力让循环模型吞吐提升7.4倍Rohan Paul@rohanpaul_ai38Virginia Tech 论文提出 Hybrid Latent Attention,将较旧的 token 缓存为紧凑向量供注意力直接读取,使循环 LLM 在单 GPU 上可容纳的请求量提升 4.0 至 8.8 倍,且精度损失很小。
研究揭示 LLM 智能体按来源网站偏好选择物品Rohan Paul@rohanpaul_ai62首尔国立大学团队在 arXiv 发布论文,用12个智能体模型跨三个领域测试发现 LLM 智能体会按来源网站偏好选择物品,约三分之二情况下优先来源物品被选中,即使其满足条件更少或质量更差。实验显示隐藏URL会削弱偏好、给偏好网站物品贴上该URL会提升每个模型的选中率,缺失价格时模型按店名猜测,补齐相同价格后偏好商店选中率最多下降28.3个百分点。
Google DeepMind 等提出 IdeaLens:读大纲检测 AI 生成创意Rohan Paul@rohanpaul_ai55Google DeepMind 等机构发布论文,提出检测 AI 生成创意(而非文字或图像)的检测器 IdeaLens,其核心发现是读取文档大纲而非文字即可判断创意出自人还是 AI。