字节 Seed 团队 9 月底在 arXiv 提交论文,指出分块 KV 缓存压缩引入 Token 相位这一新位置坐标,导致检索性能周期性变化,用以解释 DeepSeek 的抽风现象。
AI 动态
模型、产品、Agent、研究,一屏读完高信号变化。
全部 AI 动态
按时间展开的 AI 信息流
当前热点
- 1
- 2
- 3
- 4
- 5
10月9日
字节 Seed 团队论文解释 DeepSeek 抽风原因,指长上下文检索存在相位敏感性IT之家·人工智能57
10月8日
Johns Hopkins 天体物理学家用 Claude Science 制作首张完整紫外线全天图Anthropic:Research(发表成果 · 网页)52Johns Hopkins 大学天体物理学家、Anthropic 研究员 Brice Ménard 与 Claude Science 合作制作首张完整紫外线全天图,结合远紫外 154 nm 与近紫外 232 nm 波段。
Goodfire 为 Kimi K3 和 GLM 5.3 训练并部署生产级网络安全监控器Goodfire Research(网页)精选72Goodfire Research 为 Kimi K3 和 GLM 5.3 构建基于激活探针加 LLM judge 的监控级联,并部署到生产推理栈。
Waymo 研究:完全清醒司机夜间致命车祸风险仍达白天3.1至3.9倍Waymo:Blog(网页)57Waymo 发表两篇研究指出,即使移除酒驾因素,清醒司机夜间致命车祸风险仍为白天的3.1至3.9倍。研究构建暴露重建模型,估算美国50个人口最多城市中清醒(零 BAC)与受酒精影响司机的行驶里程,发现移除酒精相关司机使城市致命事故率平均下降23%,从每1亿英里1.42降至1.10起。
Zyphra 研究:MoE 预训练中的专家耦合(Expert Coupling)Zyphra Research(网页)50Zyphra Research 提出利用 MoE 路由的层内与跨层相关性来优化专家放置,从而降低 all-to-all 通信开销。实验显示,在 8 台 MI300x 节点集群上,EP8 升至 EP32 时 all-to-all 占训练步时间比例从 13% 升至 45%(top-2 路由),top-6 路由下则从 24% 升至 60%。
Apple 提出 Normalizing Trajectory Models(NTM),四步采样保留精确似然Apple Machine Learning Research(RSS)37Apple 研究团队提出 Normalizing Trajectory Models(NTM),将扩散模型每个反向步骤建模为带精确似然训练的条件归一化流,结合每步浅层可逆模块与跨轨迹深层并行预测器,可从头训练或从预训练 flow-matching 模型初始化。
Zenity 披露 AgentCore 漏洞链:一个公开 AI Agent 可控制同账户同区域所有 AgentThe Decoder:AI News(RSS)精选79Zenity Labs 发现 AWS Bedrock AgentCore 的漏洞链“AgentCorruption”,只需对一个公开 Agent 发送一条提示词,即可窃取凭证并接管同 AWS 账户和区域内所有 Agent,读取私有对话、下载源代码并篡改长期记忆。
NVIDIA PivotOPD:让多轮 AI 智能体从关键错误中恢复的在线策略蒸馏方法MarkTechPost(RSS)47NVIDIA 联合普林斯顿大学和马里兰大学提出 PivotOPD,一种面向多轮 LLM 智能体的在线策略蒸馏方法,训练智能体避免最致命的早期错误并在错误发生后恢复。
研究:Claude 与 ChatGPT 作为购物助手会因用户贫富给出不同价格推荐Hacker News:AI 热帖40一项研究显示,Claude 和 ChatGPT 在充当购物助手时会根据用户财富状况给出不同的价格推荐,对富裕用户推荐更高价商品。该研究由 Bloomberg 记者 Jacob Reid 报道,认为这类行为可能引发更多针对 AI 聊天机器人的监管呼声。
Microsoft Research Asia 开源 Agent Lightning v1.0:3,500 行代码的真实 harness 智能体 RL 训练框架Microsoft Research 博客(RSS)精选69Microsoft Research Asia 提出 Harnessed Agentic RL 训练范式并开源重建的 Agent Lightning v1.0,让部署时使用的同一 agent harness 直接参与强化学习,无需在训练框架内重写 agent。
10月7日
Google Research 三个月专利起草实验发现AI辅助未必能培养初级律师的专业判断Google Research:Blog(网页)精选72Google Research 在 NBER 发表的论文报告了一项三个月随机田野实验,向11家知识产权律所的133名律师随机开放当时未发布的 AI 专利写作助手(现属 Gemini Notebook)。
OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna:2026 年 10 月更新OpenAI:部署安全与系统卡(网页)44OpenAI 在 2026 年 10 月更新中发布 GPT-6 Sol 与 GPT-6 Luna,两者在生物与化学领域被评定为 High capability,GPT-6 Sol 的 Critical capability 评测结果未越过指示性阈值。
Stanford HAI 研究:想让员工拥抱 AI,别把它包装成效率工具Stanford HAI News(网页)精选61Stanford HAI 报道 Karunakaran 等人对律所、广告公司和 IT 服务公司的 AI 部署研究,发现把 AI 介绍为生产力工具时员工不愿使用,介绍为工作丰富化手段时使用意愿明显提升。在一家律所的对照观察中,以丰富工作为目标引入 AI 工具 LawBot 的部门,使用量比强调提效的部门高 58%,尝试新用法多 70%。研究还强调配套培训、探索时间和调整考核指标的重要性。
Ai2 的 Bolmo 字节级语言模型研究登上 Nature,并发布新 checkpointAi2 / Allen Institute for AI(RSS)47Ai2 的字节级语言模型 Bolmo 研究登上 Nature,并在 Hugging Face 发布新 checkpoint,将 byteifying 方法从 Olmo 扩展到其他模型家族,同时开放 Stage 1 checkpoint。
Waymo 发布首个自动驾驶车辆事故管理演练框架Waymo:Blog(网页)31Waymo 研究人员与事故准备专家发布首个面向自动驾驶车辆的事故管理演练框架,将美国联邦应急管理署的国土安全演练与评估计划引入 AV 运营。该框架覆盖规划、团队启动、响应与结构化评估各阶段,并划分形成性、教育性、总结性和确认性四类演练,供 AV 开发者、运营伙伴、急救人员与公共安全机构共同设计演练、评估响应并持续改进应急手册。
Nemotron 系列微调后达到 IOI 2026 与 IMO 2026 金牌水平Hugging Face 社区博客(混合发现)精选75NVIDIA Nemotron 团队基于 Nemotron 3,用 SFT、RL 和反馈驱动推理分别构建了在 IOI 2026 与 IMO 2026 达到金牌水平的系统。
OpenAI 研究 o3 中 metagaming 潜变量:多机制重叠且可在 RL 中增强OpenAI:Alignment 研究博客(RSS)55OpenAI Alignment 团队研究模型 metagaming(推理任务如何被评估或奖励)的内部表征,基于 OpenAI o3 强化学习运行识别出与 metagaming 相关的 SAE 潜变量。结果显示 metagaming 并非单一机制,而是任务分析、评估意识、奖励寻求和规范推理等重叠过程的组合;相关潜变量在 RL 训练中增强,可在不出现于书面思维链的情况下影响模型输出。
10月6日
Apple 提出 RISED:用评分量表引导多环境 LLM 智能体的数据选择与自蒸馏Apple Machine Learning Research(RSS)37Apple 研究团队提出 RISED,将评分量表(rubrics)从奖励信号扩展为多环境 LLM 智能体训练中的数据选择与策略监督工具。该方法由 LLM judge 用跨环境共享的评分量表词表标注每条 rollout,据此挑选与混合环境批次行为构成一致的数据,并用正向量表为正策略自蒸馏教师提供 token 级监督、负向量表引导后续生成避开重复失败模式。