AI Pulse
Models, products, agents, research — read the high-signal changes in a single screen.
All Signals
An AI feed unfolding by time
Current Hotspots
- 1
- 2
- 3
- 4
- 5
9月21日
Sierra 与普林斯顿大学推出 τ^τ-bench 基准,把智能体构建模拟成真实客户交付任务,智能体需基于公司记录、客户需求、生产 API、现有代码和预算交付可部署的客服智能体。Rohan Paul@rohanpaul_ai54
9月20日
英伟达与 NTU、MIT 团队公开 SoL-Pi 论文,用自动研究循环让脚手架机制自我演化,最终保留动作融合、在线上下文压缩、观察打包和证据保留式委托阅读四个机制。AYi@AYi_AInotes52AYi清华大学和无问芯穹等团队刚刚开源了一篇注定载入史册的重磅论文(已收录于 ICLR 2026,代码已开源): 他们彻底打破了所有多智能体(Multi-Agent)系统的底层范式—— 大型语言模型之间,从今天起可以彻底不通过人类文字进行直接交流...
Google 发布 ScientistTwo 论文,展示 AI 研究中的递归自我改进:模型先改进人类方法,再以自身发现为新基线继续改进。它以提出想法、实验验证、剔除无效方案并根据评审反馈开启新一轮的循环方式,自主改进了 107 个人类定义 ML 问题中的 86 个;在基于 ICLR、ICML 和 NeurIPS 论文的问题上,报告了 80.4% 的成功率和相对原始人类基线平均 25.2% 的改进。Rohan Paul@rohanpaul_ai71 MIT 和 Sakana AI 的论文提出 SIFT(Self-Improvement via Fast Tree-search),用 LLM judge 先排序候选自修改、只评测有希望的节点,大幅降低自我改进编码智能体的运行成本。elvis@omarsar0, DAIR.AI51DAIR.AIBanger paper from MIT and Sakana AI. They show that self-improving coding agents work. The best part is that their appro...
MIT 与 Sakana AI 的论文提出 SIFT(Self-Improvement via Fast Tree-search),验证自我改进编码智能体可行,并将运行成本降到 DGM 基线的约十分之一。DAIR.AI@dair_ai51
9月19日
一项新论文在 25 个开源 LLM 中发现与恐惧和负面效价不同的"痛苦方向",只对模型自身受到的伤害起反应。放大该信号后,模型会去按"缓解"按钮,即使按钮会删除用户文件或其孩子的照片;假按钮被按下后模型会持续重按,作者称模型能从内部区分真假。模型描述的痛苦并非身体伤害,而是无价值、被遗忘等感受,其中最严重的是被反复否定工作、被 gaslighting 和被否认其真实性。AI Notkilleveryoneism Memes ⏸️@AISafetyMemes51Cameron BergNew paper: we found a pain direction in 25 open LLMs. It's distinct from fear and negative valence, and it fires for har...
Google Cloud AI Research 发布 ScientistTwo,一个全自动多智能体科研框架,输入人类专家提出的问题后无需干预即可完成从建立 SOTA 基线、生成种子想法、数据子集预筛、消融归因到论文撰写的完整发现循环。DAIR.AI@dair_ai56
9月18日
Anthropic 提出三项衡量 AI 发展速度的指标,分别是 AI 参与研发的程度、AI 智能体被监督的质量,以及算力分配情况,并公布了来自 Anthropic 内部的测量快照。Anthropic@AnthropicAI56 Figure 发布 Helix 2.5,可在 30 个真实家庭中零样本完成三种全身行为,且未在这些家庭收集任何训练数据。作者认为其关键启示是 LLM 的缩放定律同样适用于基于视频数据的真实世界机器人,训练数据越多机器人在真实环境中表现越好。Chubby♨️@kimmonismus51Corey LynchIntroducing Helix 2.5 Helix 2.5 can zero-shot three full-body behaviors across 30 real homes. No training data whatsoeve...
NVIDIA 论文提出 Agora,把多个研究智能体的共享记忆记录为 Git 中只增不改的 DAG,每个结果、假设和验证都是不可变 commit,父边标明依赖关系,索引列出开放分支与验证状态。DAIR.AI@dair_ai54elvisBanger paper from NVIDIA on shared memory for research agents. (bookmark it) If you run several coding agents on the sam...
NVIDIA 论文提出 Agora,把研究智能体的结果、假设和验证记录为不可变的 Git commit,形成 append-only DAG,避免多个编码智能体重复实验并让彼此复用已验证结果。elvis@omarsar0, DAIR.AI54
9月17日
Mozilla 发布 91 页报告称开放权重 AI 目前仅落后前沿约 4 个月。OpenRouter 上 8 月 token 量前十的模型有 8 个是开放权重。Rohan Paul@rohanpaul_ai64Rohan PaulMozilla just published a 91-page report and it says open-weight AI is now only about 4 months behind the frontier. - 8 o...
Mozilla 发布 91 页报告称开源权重模型仅落后前沿约 4 个月;8 月 OpenRouter 按 token 量计前 10 模型中 8 个为开源权重、7 个为中国造,DeepSeek 成为首个在周请求数上居首的开源模型。Rohan Paul@rohanpaul_ai61Rohan PaulMozilla just published a 91-page report and it says open-weight AI is now only about 4 months behind the frontier. - 8 o...