马东锡 NLP 称,拜访谷歌前因 Gemini 表现不佳而看低这家公司,进入谷歌后则被其对员工的关爱打动,认为福利安排细致且不计成本,午餐水准很高,据称中国办公室甚至能吃到整只甲鱼。他因此建议"牛马"应去谷歌这类公司上班,而不是去其他公司接受 PUA,并调侃 AGI 是否实现与个人无关,活得长短才与自己相关。
AI 动态
模型、产品、Agent、研究,一屏读完高信号变化。
全部 AI 动态
按时间展开的 AI 信息流
当前热点
- 1
- 2
- 3
- 4
- 5
10月9日
马东锡NLP谈谷歌参访:Gemini 太拉但员工福利到位马东锡 NLP@dongxi_nlp20 用腾讯游戏游点灵搭游戏,我去了马栏山AI游戏训练营看大学生们的真实水平公众号:卡尔的AI沃茨35作者用腾讯游戏游点灵几句话搭出一个"给超级英雄盖楼"的跳跃策略小游戏并已公开,玩家只有9格泥土,需通过1层、5层、3层的楼高搭配让主角加速荡向终点。在游点灵·湖南马栏山集团AI游戏训练营现场,在读大学生做出的海鸥偷薯条、海岛硬核求生等游戏机制完善,游点灵自带4万多个游戏资产并支持可视化调参和二创。
AI 时代需求定义与设计描述仍然缺失indigo@indigox34AI 已能快速实现或复制功能,但如何定义需求、清晰描述设计依然缺失。随着功能定义层次上移、目标愈发抽象,中间环节将全部由智能体实现,最终只剩提出需求的人和检查结果的人,软件逻辑层变成模型输出的 token。
李飞飞发问:机器时代谁来定义美Fei-Fei Li@drfeifei, World Labs14我认识的每一位数学家朋友,都能从他们研究的数字、形状和自然现象中看到美。在机器时代,谁来定义美?🤔
MarkTechPost 教程拆解 Google Research 的 RRSI:在离线模拟环境中掌握自改进 AI 智能体的编辑保留规则MarkTechPost(RSS)55MarkTechPost 发布教程,从 google-research 仓库安装 RRSI(Regularized Recursive Self-Improvement),只驱动其决定保留哪些编辑的纯 Python 规则部分,并接入自建模拟 agent 环境做 ground truth 审计。
Meta 首席 AI 官 Alexandr Wang 解释 Muse 智能体的安全虚拟机设计Rohan Paul@rohanpaul_ai54Meta 首席 AI 官 Alexandr Wang 介绍每个 Muse 智能体运行在独立的 secure VM 沙箱中,用户数据只存储在该隔离环境内。智能体对外发送信息时由单独的 sentinel 智能体检查并拦截信用卡号、社会安全号等敏感数据,且访问新网站需用户批准;未来还将推出加密的 confidential VM,目标是 WhatsApp 级别保障,但可能更慢。
开源 MCP 服务器 REA:用 AI 智能体逆向分析任意应用功能Rohan Paul@rohanpaul_ai55Rohan Paul 介绍了一个约 29k stars 的 GitHub 开源项目 REA(Reverse Engineer Anything),一个面向二进制、应用和运行时行为逆向工程的 MCP 服务器。无需应用源码即可让 AI 智能体调查某项功能,REA 将应用机器码转回可读代码,智能体阅读代码、解释功能原理、展示证据,并能为你的项目构建自己的实现版本。
马东锡调侃 Tibo 与 Codex Reset马东锡 NLP@dongxi_nlp13我认为 Tibo @thsottiaux 就是 OpenAI 的雨宫阳平,他说的任何 codex 的新功能都不再重要了,大家就等那一句: Codex Reset “中华冷面开始供应了!”
郭宇谈 Agent 时代:软件为何会像牛奶一样便宜indigo@indigox29郭宇在 INDIGO TALK 中回顾:2015 年在字节初见神经网络产品,十年后在东京独自用 Agent 做出三十多个产品,随后陷入倦怠。节目从抖音意外胜出聊起,谈及 Vibe Coding 的决策负担、Agent OS、智能的五个层次,以及软件像牛奶一样便宜后真正要交付什么。
Gemini 2.5 医疗建议质量比肩医生Ethan Mollick@emollick41在急诊场景中,已过时的 Gemini 2.5 Pro 和 Gemini 2.5 Flash(无法访问患者病历)给出的建议,被其他医生评为与医生质量相当。未发现安全问题。 此后模型已显著提升。
INDIGO TALK EP52 对谈郭宇:当软件像牛奶一样便宜,我们还要交付什么indigo@indigox55indigo 与字节跳动前资深员工郭宇对谈,郭宇称一个人用 Agent 做出三十多个产品后陷入倦怠,因为 Vibe Coding 把整个团队的决策负担压到一人身上。对谈还讨论了 Agent OS、智能的五个层次、智能商品化会使软件像牛奶一样便宜,以及年轻人是否该把工作当作必选项。
Musk 称 Grok Bot 性价比极高Elon Musk@elonmusk, xAI27用 Grok @Bot 就像花 peanuts 雇一个超级聪明、勤奋的人
斯坦福 CS146S 第三周课程公开:Agent Skills 与 CLI邵猛@shao__meng72斯坦福大学 @mihail_eric 的「CS146S: The Modern Software Developer」第三周课程公开,主题为 Agent Skills and CLI,首次加入客座讲师 @leerob,讲义见 https://themodernsoftware.dev。
Claude Code 数字鞭子作者恐遭封禁Yuchen Jin@Yuchenj_UW28给 Claude Code 做了这个数字鞭子的人,肯定会被以“虐待或残忍行为”为由终身封禁 Claude。
Matt Pocock 分享 AI Coding Agent 流程选择框架:按改动规模匹配流程重量邵猛@shao__meng62Matt Pocock(281K ⭐ 开源项目 Skills For Real Engineers 作者)分享 AI Coding Agent 流程选择决策框架。
OpenAI 调侃 GPT-6 洗碗广告OpenAI Developers@OpenAIDevs20对细节的关注有点令人担忧。
密歇根大学 EECS 498 AASE 课程解读:把 AI 编程方法论做成五个 Skill邵猛@shao__meng71密歇根大学 2026 年秋季开设 EECS 498-016「Applied Agentic Software Engineering」,无教材无考试、总花费零美元,由 Marcus Darden 主讲,全部讲义 L01–L11 已在 GitHub 公开。
独立研究者用 Claude Code 在 NASA TESS 数据中发现疑似新行星Rohan Paul@rohanpaul_ai53一位独立研究者用 Claude Code(Opus 5.5 和 Fable 5.1)分析 NASA TESS 数据,发现一个自 2018 年起未被报告的行星候选体。
Meta 首席 AI 官谈 AI 最大恐惧Rohan Paul@rohanpaul_ai26Alexandr Wang(Meta 首席 AI 官)对 AI 最大的恐惧 “如果说有什么让我对 AI 夜不能寐,大概就是这件事,也许是我最害怕的:我们在全球范围内部署智能体,然后它们的行为不符合我们的需要,但我们甚至没有注意到,因为我们太忙了或其他什么。” ---- 完整视频在“Cleo Abram”YouTube 频道,(链接在评论中)
Shaders 开源:200+ WebGPU 视觉特效封装为声明式组件,React/Vue/Svelte/Solid/原生 JS 共用一套 props邵猛@shao__meng67Shaders 宣布开源其 WebGPU 着色器特效组件库,提供 200+ 个视觉效果组件,支持 React / Vue / Svelte / Solid / 原生 JS 共用一个包和同一套 props,MIT 协议,可免费导出任意框架代码,GitHub 地址为 https://github.com/shader-effects-inc/shaders。
陶哲轩批评 OpenAI 发布 719 篇 AI 数学证明:人类来不及理解和消化IT之家·人工智能73陶哲轩于 10 月 7 日在 mathstodon 发帖,批评 OpenAI 10 月公布 719 份 AI 数学解答(涵盖 372 个结果族)的做法,称这会把开放问题变成可批量消耗的资源。他不反对 AI 辅助研究,但反对把快速攻克著名难题当产品展示,指出约 42% 证明未经形式化处理、仅 10 份附推理链,未达到 AGMAI 建议的披露标准,并担心出现大量无人能消化的证明。
白宫AI主管谈AI安全与提速Rohan Paul@rohanpaul_ai43白宫AI主管Jay Clayton在CNBC表示:为了安全而放慢AI发展是本末倒置 “人们谈论平衡,就好像在说,好吧,为了安全我必须放慢速度。 实际上恰恰相反。你必须以促进安全的方式来开发技术。而这正是这里可以做到的。” ---- 完整视频见“CNBC Television”YouTube频道,(链接在评论中)
OpenAI 数学突破速度超过人类理解:数学家面临身份危机Platformer(热点 RSS)25OpenAI 在数学问题上的突破速度已超过人类理解解题过程的速度,可能引发数学家的身份危机。Platformer 报道指出,这一进展让人追问下一个受冲击的领域会是什么。
Snyk 如何将内部支持 Agent 变成面向客户的产品功能LangChain:Blog(RSS)49Snyk 将内部支持 Agent 演进为面向所有付费客户的 Snyk Assist,该 Agent 基于 LangChain 和 LangGraph 构建,并在 LangSmith 中管理可观测性。
游戏、软件、硬件,一切终将开源?Oran Ge@oran_ge57Orange AI 发布 Next Token 播客第五期的转写文章,讨论 Opus 5.5 发布及 RSI 到来后对软件、硬件和游戏行业的冲击。文中举例 Opus 5.5 直接根据旧剧本写出可玩游戏、反编译塞尔达等老游戏进度加快、AI 重写 Photoshop 类软件规避起诉、Muse 通用固件让 ESP32 硬件变得 Agent Ready,并认为法律和生态尚未跟上,最终能留下的东西不多了。
Luma AI:Jon Erwin 用 AI 拍摩西Luma AI@LumaLabsAI33预算曾决定一个故事能在哪里拍成。 Jon Erwin 在曼哈顿海滩的一个舞台上拍出了《摩西》,用真实演员,加上 AI 把他们带入故事所需的任何世界。
阿里巴巴蔡崇信:五年后 AI 将如今天的互联网,融入社会的每个环节IT之家·人工智能31阿里巴巴集团主席蔡崇信在意大利都灵 Wave by Vento 2026 上预判,五年后人们可能不再单独讨论 AI,因为它将像今天的互联网一样融入业务的每个环节。
Meta 首席 AI 官汪滔:别指望 Muse 自动帮你赚 1 万美元,记忆能力是改进重点IT之家·人工智能44Meta 首席 AI 官汪滔表示,用户想让 Muse 智能体帮忙赚到 1 万美元,自己也得付出努力,Meta 正持续改进 Muse 的记忆能力以处理更复杂任务。Muse 上线一个月后仍位居苹果 App Store 免费应用榜首,Meta 正为其探索订阅、交易抽成等可持续商业模式,目前并未花太多时间考虑广告。
Arena 解读对齐指数三大信号Arena@arena44今天在 @tbpn 上收听 @ml_angelopoulos 带来的另一期 Arena Alignment Index 解读
xAI 调侃 AI 安全测试新方案Elon Musk@elonmusk, xAI25很高兴宣布,所有超级智能组织现已共同同意 AI/SI 安全的终极方案: 把所有测试都搬到 Delta Airlines 的航班上进行,在那里上网是绝对不可能的!
Claude Managed Agents 自动化搭建指南:定时读取 Slack 与 GitHub 并发布更新Claude Devs@ClaudeDevs62一篇介绍如何用 Claude Managed Agents 搭建自动化的教程,示例为部署一个按计划读取 Slack 和 GitHub、具备凭证与记忆并发布更新的智能体。搭建可通过一条 Claude Code 命令完成,Max 和 Team 套餐中包含的 API credits 可用于该用途,原文链接 https://claude.dev/blog/building-effective-agent-automations/。
Thariq 开源用 Claude API 每日生成首页的 Chrome 扩展 ai-newtabThariq@trq21259Thariq 更正此前失误,将自己在用的 Chrome 扩展仓库设为公开,地址为 https://github.com/ThariqS/ai-newtab。该扩展每天根据他浏览的网站生成 AI 首页,替换 Chrome 的新标签页;作者此前提到 MAX 计划用户每月可获得 100 或 200(与套餐匹配)的 Claude API 额度,可用于构建个人 AI 工具。
Grok Bot 一键配置模拟掌机Elon Musk@elonmusk, xAI34把最难搞的问题交给 Grok @Bot
Grok Bot 能力升级并接入 XElon Musk@elonmusk, xAI32而 Grok @Bot 只会从这里变得更好 🚀 🚀 你完全可以打造一家全部由 Grok Bot 组成的公司!
MIT 报告作者 Sasha Rakhlin 谈 AI 时代学术界的最佳前行路径MIT News(RSS)39MIT 统计与数据科学中心主任 Sasha Rakhlin 撰文探讨 AI 如何改变学术界,重点聚焦研究生科研与培养。他指出,验证速度与可靠性决定学科被 AI 推进的快慢,数学领域已有模型达到国际数学奥林匹克金牌水平,并在一年后产出新研究结果。他建议院系重新界定学术贡献与评价标准,并建设共享 AI 科研基础设施,以保留实验室的隐性知识与失败经验。
NVIDIA Omniverse 如何用 GPT-6 Astra 等前沿 AI 智能体把想法变成仿真应用NVIDIA Blog(RSS)34NVIDIA 展示开发者如何用 GPT-6 Astra、Claude Fable 5 等前沿 AI 智能体配合 Omniverse 库构建仿真应用,覆盖人形机器人仓库控制、自动驾驶测试、数字孪生传感器校验等场景。其中 Robo Olympics 项目中 Unitree G1 人形机器人在 100 次仿真试验里有 64 次跨过单个栏架,另有智能体在约三天内从零创建两个数字孪生并改进两个已有孪生。
10月8日
Block 如何用 Claude Fable 编排数千个 pull request 的代码迁移Claude:Blog(网页)精选66Anthropic 发表对 Block AI capabilities 负责人 Bradley Axen 的访谈,介绍 Block 用 Claude Fable 5 编排大规模代码迁移:Fable 做数据模型、API 规格等高层设计,再调度数十个更小的 Opus 或 Sonnet 模型执行文件修改和测试,一次迁移可能合并上千个 pull request。
Databricks Lakebase Postgres 借助 LTAP 架构实现分钟级 TB 级数据加载Databricks:Blog(RSS)47Databricks 为 Lakebase Postgres 引入 LTAP 架构,将批量数据加载从主计算节点卸载到 Spark 分布式引擎,内部基准测试显示加载 1 TB 数据现在只需不到 5 分钟。
Databricks 介绍用 Lakebase 数据库分支为编码智能体构建隔离开发工作流Databricks:Blog(RSS)51Databricks 博客介绍如何用 Lakebase Postgres 的数据库分支能力支持 Agentic SDLC。Lakebase 可在不到一秒内分支任意大小的数据库,采用 copy-on-write 共享父分支数据、支持 scale-to-zero。
Hugging Face 工程师用 ML Intern 以约 103 美元自制 7 个小模型Hugging Face 官方团队博客精选72Hugging Face 工程师 yuvraj sharma 用 HuggingChat 的 ML Intern 模式在几天内做出 7 个模型,包括可在 CPU 运行、99.7% 有效输出的 0.8B 提示词重写器,以及将柑橘病害识别准确率从 14.9% 提升到 52.8% 的 Qwen3.5-2B 微调模型等,全部计算成本约 103 美元。