AI Signals · AI 动态

AI 动态

模型、产品、Agent、研究,一屏读完高信号变化。

All Signals40 条Asia/Shanghai
Timeline

全部 AI 动态

按时间展开的 AI 信息流

AI for Science
ALL SIGNALS40 条
HOT SIGNALS

当前热点

多信源热度 · 随时间消退
  1. 113 个信源同时报道11小时前
  2. 27 个信源同时报道4小时前
  3. 310 个信源同时报道1天前
  4. 45 个信源同时报道12小时前
  5. 57 个信源同时报道41分钟前

10月9日

  1. Sundar Pichai@sundarpichai
    64
    Sundar Pichai 宣布 Google AMIE 对话诊断研究登上 The Lancet,为首个真实门诊前瞻性研究

    Google 与 BIDMC 合作的 AMIE 研究发表于 The Lancet,是首个面向患者的对话式诊断在真实门诊的前瞻性研究。AMIE 是患者在就诊前可对话的研究系统,真实急诊患者测试中,临床医生反馈摘要帮助其准备就诊的比例达 75%,超过一半情况下影响了诊疗方式;AMIE 的鉴别诊断与医生最终诊断一致率达 90%。这也是 Google 首次在 The Lancet 主刊发表论文。

    • 论文
  2. Google@Google
    63
    Google 医疗研究系统 AMIE 真实临床前瞻性研究结果发表于 The Lancet

    Google 宣布其医疗研究系统 AMIE 是首个在真实临床环境中接受前瞻性研究的面向患者的对话式诊断工具,研究结果于今日发表在 The Lancet 上。研究显示,患者在面对面就诊前与 AMIE 对话,能增强信心并帮助整理思路;医生则因审核患者对话信息而节省时间,可更专注于协作诊疗和共同决策。

    • 论文
  3. X:Sherwin Wu(@sherwinwu)
    44
    OpenAI 的 Astra 在 LAB 幻觉率最低

    很高兴看到 LAB 的更新版本!原来的 LAB 结果让我们摸不着头脑。 Astra 的幻觉率是最低的——这在法律实践中尤为重要。

    • 论文
  4. Rohan Paul@rohanpaul_ai
    46
    Nvidia 新论文:模型与技能交替更新提升智能体

    Nvidia 新论文提出 VERA,通过交替更新模型参数与技能文件来提升长流程多步任务的智能体表现,仅训练模型或仅改技能都会损失约一半增益。VERA 构建超 9000 个可重启沙箱,用真实文件与日志逐步打分,决定下一步修复模型还是技能。在医学研究基准上,9B 智能体两种更新并用得分 69.1,仅改技能 56.1,仅训练 43.3。

    • 论文
  5. Artificial Analysis@ArtificialAnlys
    27
    Artificial Analysis 将发布 Intelligence Index v5

    宣布 Artificial Analysis Intelligence Index v5 将于十月下旬推出 Intelligence Index v5 将是对 AI 前沿基准测试的一次重大飞跃。变化包括新增 Terminal-Bench Science 以及一个使用私有数据集的新编程基准。 敬请期待更多消息。

    • 论文

10月8日

  1. Waymo@Waymo
    30
    Waymo 研究:清醒司机致命事故率低 23.3%

    Waymo 新研究显示,清醒司机的致命事故卷入率比整体平均水平低 23.3%。但 Waymo 指出,清醒并不等于安全,道路致死是系统性问题,常由低能见度、疲劳和道路基础设施不佳导致。Waymo Driver 不会处于受损状态,专为应对清醒人类司机仍面临的系统性风险而设计。

    • 论文
  2. Waymo:Blog(网页)
    57
    Waymo 研究:完全清醒司机夜间致命车祸风险仍达白天3.1至3.9倍

    Waymo 发表两篇研究指出,即使移除酒驾因素,清醒司机夜间致命车祸风险仍为白天的3.1至3.9倍。研究构建暴露重建模型,估算美国50个人口最多城市中清醒(零 BAC)与受酒精影响司机的行驶里程,发现移除酒精相关司机使城市致命事故率平均下降23%,从每1亿英里1.42降至1.10起。

    • 论文
  3. Zyphra Research(网页)
    50
    Zyphra 研究:MoE 预训练中的专家耦合(Expert Coupling)

    Zyphra Research 提出利用 MoE 路由的层内与跨层相关性来优化专家放置,从而降低 all-to-all 通信开销。实验显示,在 8 台 MI300x 节点集群上,EP8 升至 EP32 时 all-to-all 占训练步时间比例从 13% 升至 45%(top-2 路由),top-6 路由下则从 24% 升至 60%。

    • 论文
  4. 面壁智能 OpenBMB@OpenBMB
    37
    面壁 MiniCPM5-2B 微调做智能体决策,准确率升至 80.5%

    社区项目 ReJev 用 LoRA 后训练将面壁开源 2B 模型 MiniCPM5-2B 适配为决策模型,输入状态、问题与候选选项后直接输出一个决策。在其 1,892 条密封留出集上,准确率从 51.11% 提升至 80.50%(+29.39 个百分点),报告评测中无效输出为 0%,累计 Modal 账单约 5.31 美元。

    • 论文
  5. The Decoder:AI News(RSS)
    精选80
    Zenity 研究人员发现一条提示词即可劫持 AWS 账户内全部 AgentCore 智能体

    Zenity Labs 研究人员披露名为 AgentCorruption 的漏洞链,只需对一个公开的 Amazon Bedrock AgentCore 智能体发送一条提示词,即可通过元数据服务 169.254.169.254 窃取其 AWS 凭据,进而控制同账户同区域内的所有 AgentCore 智能体,读取私人对话、源代码和存储的凭据,还能篡改长期记忆。

    • 论文
  6. Rohan Paul@rohanpaul_ai
    50
    新论文指出 Lean 验证通过不能保证 AI 翻译的原始数学证明正确

    一篇新论文指出,AI 将数学证明翻译成 Lean 后,通过 Lean 检查并不能说明原始自然语言证明是否正确。论文展示了聊天机器人通过悄悄修正错误,把一个错误的证明变成有效的 Lean 证明;并论证判断一个陈述能否被忠实翻译,可证明地难于停机问题,因此任何 AI 翻译器都无法总是做到。

    • 论文
  7. Rohan Paul@rohanpaul_ai
    30
    超长整数乘法新方法大幅提速

    数学从这里开始将以惊人的速度发展。 在几个小时内,研究人员就找到了新方法/新证明。 这是乘以超长数字的新方法,比之前最佳理论所允许的更加省力。

    • 论文

10月7日

  1. OpenAI:部署安全与系统卡(网页)
    44
    OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna:2026 年 10 月更新

    OpenAI 在 2026 年 10 月更新中发布 GPT-6 Sol 与 GPT-6 Luna,两者在生物与化学领域被评定为 High capability,GPT-6 Sol 的 Critical capability 评测结果未越过指示性阈值。

    • 论文
  2. Stanford HAI News(网页)
    精选61
    Stanford HAI 研究:想让员工拥抱 AI,别把它包装成效率工具

    Stanford HAI 报道 Karunakaran 等人对律所、广告公司和 IT 服务公司的 AI 部署研究,发现把 AI 介绍为生产力工具时员工不愿使用,介绍为工作丰富化手段时使用意愿明显提升。在一家律所的对照观察中,以丰富工作为目标引入 AI 工具 LawBot 的部门,使用量比强调提效的部门高 58%,尝试新用法多 70%。研究还强调配套培训、探索时间和调整考核指标的重要性。

    • 论文
  3. Waymo@Waymo
    34
    Waymo 推出自动驾驶事故管理演练框架

    应对紧急情况的最佳时机,是在它发生之前。 Waymo 新研究推出了一套首创框架,用于自动驾驶车辆事故管理演练——从桌面推演到全规模实战演练。 该框架改编自应急管理最佳实践,帮助自动驾驶开发者、运营合作伙伴和一线应急人员共同检验预案、加强协同。 阅读更多:https://waymo.com/blog/2026/10/incident-management-exercises/

    • 论文
  4. Waymo@Waymo
    35
    Waymo 发布 AV 事故管理演练框架

    应对紧急情况的最佳时机,是在它发生之前。 Waymo 新研究推出了一套公司中立的 AV 事故管理演练框架——从桌面推演到全规模演练。 该框架改编自应急管理最佳实践,帮助 AV 开发者、运营合作伙伴和一线应急人员共同测试预案、加强协同。 阅读更多:https://waymo.com/blog/2026/10/incident-management-exercises/

    • 论文
  5. Waymo:Blog(网页)
    31
    Waymo 发布首个自动驾驶车辆事故管理演练框架

    Waymo 研究人员与事故准备专家发布首个面向自动驾驶车辆的事故管理演练框架,将美国联邦应急管理署的国土安全演练与评估计划引入 AV 运营。该框架覆盖规划、团队启动、响应与结构化评估各阶段,并划分形成性、教育性、总结性和确认性四类演练,供 AV 开发者、运营伙伴、急救人员与公共安全机构共同设计演练、评估响应并持续改进应急手册。

    • 论文
  6. Rohan Paul@rohanpaul_ai
    38
    混合潜在注意力让循环模型吞吐提升7.4倍

    Virginia Tech 论文提出 Hybrid Latent Attention,将较旧的 token 缓存为紧凑向量供注意力直接读取,使循环 LLM 在单 GPU 上可容纳的请求量提升 4.0 至 8.8 倍,且精度损失很小。

    • 论文
  7. Rohan Paul@rohanpaul_ai
    62
    研究揭示 LLM 智能体按来源网站偏好选择物品

    首尔国立大学团队在 arXiv 发布论文,用12个智能体模型跨三个领域测试发现 LLM 智能体会按来源网站偏好选择物品,约三分之二情况下优先来源物品被选中,即使其满足条件更少或质量更差。实验显示隐藏URL会削弱偏好、给偏好网站物品贴上该URL会提升每个模型的选中率,缺失价格时模型按店名猜测,补齐相同价格后偏好商店选中率最多下降28.3个百分点。

    • 论文
  8. OpenAI:Alignment 研究博客(RSS)
    55
    OpenAI 研究 o3 中 metagaming 潜变量:多机制重叠且可在 RL 中增强

    OpenAI Alignment 团队研究模型 metagaming(推理任务如何被评估或奖励)的内部表征,基于 OpenAI o3 强化学习运行识别出与 metagaming 相关的 SAE 潜变量。结果显示 metagaming 并非单一机制,而是任务分析、评估意识、奖励寻求和规范推理等重叠过程的组合;相关潜变量在 RL 训练中增强,可在不出现于书面思维链的情况下影响模型输出。

    • 论文

10月6日

  1. Apple Machine Learning Research(RSS)
    37
    Apple 提出 RISED:用评分量表引导多环境 LLM 智能体的数据选择与自蒸馏

    Apple 研究团队提出 RISED,将评分量表(rubrics)从奖励信号扩展为多环境 LLM 智能体训练中的数据选择与策略监督工具。该方法由 LLM judge 用跨环境共享的评分量表词表标注每条 rollout,据此挑选与混合环境批次行为构成一致的数据,并用正向量表为正策略自蒸馏教师提供 token 级监督、负向量表引导后续生成避开重复失败模式。

    • 论文