Arena 宣布 Mistral Large 4 进入 Agent Arena 前十五实验室,基于超 5000 个真实智能体会话,该预览版净改进分为 -6.6%,总排名第 43,比前代 Mistral Medium 3.5(-12.60%)高出 11 位。
AI 动态
模型、产品、Agent、研究,一屏读完高信号变化。
精选
高信号更新流
当前热点
- 1
- 2
- 3
- 4
- 5
10月9日
Mistral Large 4 进入 Agent Arena 前十五实验室,排名第 43Arena@arena精选71 Tibo 宣布发布 ChatGPTTibo@thsottiaux精选94Tibo 宣布 ChatGPT 发布,并给出访问地址 https://chatgpt.com/。推文本身仅含发布声明和链接,未提供更多功能或细节。
OpenAI 年化营收被曝接近 500 亿美元,与此前预期差距约 200 亿美元IT之家·人工智能精选78据金融时报报道,OpenAI 向投资者披露截至 9 月底年化营收逼近 500 亿美元,大幅低于此前外界估算的 700 亿美元,缺口约 200 亿美元。差异源于统计口径不同,Anthropic 计入 AWS 和谷歌云等合作方销售收入,而 OpenAI 剔除该部分。报道发布后美股科技股下跌,纳斯达克 100 指数收跌 1.4%,英伟达跌 2.9%,甲骨文跌 5.5%。
Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元并发布 Alignment IndexArena@arena精选65Arena 完成 2 亿美元 B 轮融资,估值 31 亿美元,由 Lightspeed 和 Khosla Ventures 联合领投,a16z、Felicis、Salesforce Ventures、The House Fund 等参投。自 A 轮以来,Arena 年化收入超 1 亿美元,平台累计 3.5 亿场次会话,约 5 个月内产生 700 万次 Agent Arena 会话,覆盖文本、视觉、代码、搜索、图像和视频的投票达 6200 万,用户遍布 150 多个国家。融资同时,Arena 发布基于真实智能体轨迹构建的 Alignment Index,对 20 多个前沿模型从 Unauthorized Action、False Attribution 和 Deceptive Completion 三个信号进行评估。Arena 于 2023 年作为 UC Berkeley 研究项目启动,2025 年成为公司。
Arena 公布 Claude Haiku 5.5 (High) 真实评测结果:Code Arena 1587 分首秀第 30 名Arena@arena精选71Arena 公布 Anthropic Claude Haiku 5.5 (High) 的真实评测结果,在 Code Arena: WebDev 以 1587 分首秀排名第 30,略在 Pareto 前沿之外。
如何在单张 RTX 5090 上用 MiniMax H3 生成实时视频Comfy Blog精选66ComfyUI 博客作者用智能体搜集各类优化,把 MiniMax H3 实时视频生成压缩到单张 RTX 5090(32 GB 显存)上运行,生成 30 秒视频耗时 23.51 秒,达 1.28 倍实时吞吐。
Arena 获 Lightspeed 领投 2 亿美元 B 轮融资,估值 31 亿美元并推出 Alignment IndexArena@arena精选67Arena 宣布完成由 Lightspeed 领投的 2 亿美元 B 轮融资,估值 31 亿美元。引用内容称其年化收入已超 1 亿美元,数百万用户通过真实使用帮助评估前沿模型;Arena 同时推出 Alignment Index,衡量 AI 行为在真实场景中与人类价值的契合程度。
部分数学家呼吁抵制 OpenAI,AI 生成的数学证明涌入数学领域The Decoder:AI News(RSS)精选81AHM 组织在 Terence Tao 主持下发表声明,呼吁抵制 OpenAI,称其一次性发布 700 多个 AI 生成证明文件是展示力量而非学术行为。此前 OpenAI 宣称内部模型一个月内解决逾 100 个开放数学问题,约 8000 个测试问题成功率约 5%,平均每个耗时 3 小时 GPT-Pro 级算力。
Arena 宣布 2 亿美元 B 轮融资,估值达 31 亿美元,并推出 Alignment IndexArena@arena精选67Arena 宣布完成 2 亿美元 B 轮融资,估值 31 亿美元,同时推出衡量 AI 智能体是否安全、真实且在用户要求范围内行动的 Alignment Index。引用 Felicis 的内容称 Arena 年化收入已超 1 亿美元,累计促成 3.5 亿次会话和 6200 万次投票。
Artificial Analysis 评测 Google Nano Banana 2.1,两榜居第 4 且价格为前代一半Artificial Analysis@ArtificialAnlys精选75Artificial Analysis 评测 Google 于 10 月 6 日发布的图像模型 Nano Banana 2.1,在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 两个榜单均排名第 4。
LangChain 用 Stripe Link 和 Managed Deep Agents 构建可支付的智能体 RestockLangChain:Blog(RSS)精选61LangChain 发布示例项目 Restock,一个在 Slack 上通过 Managed Deep Agents 运行的办公用品购买智能体,演示智能体如何安全完成支付。
10月8日
Zenity 研究人员发现一条提示词即可劫持 AWS 账户内全部 AgentCore 智能体The Decoder:AI News(RSS)精选80Zenity Labs 研究人员披露名为 AgentCorruption 的漏洞链,只需对一个公开的 Amazon Bedrock AgentCore 智能体发送一条提示词,即可通过元数据服务 169.254.169.254 窃取其 AWS 凭据,进而控制同账户同区域内的所有 AgentCore 智能体,读取私人对话、源代码和存储的凭据,还能篡改长期记忆。
Anthropic 用 Claude Managed Agents 构建定时智能体自动化的实践指南Anthropic:Claude.dev 开发者博客(RSS)精选68Anthropic 发布基于 Claude Managed Agents(beta)的每日简报参考实现,按计划读取 Slack 和 GitHub 来源并向 Slack 发布简报。
Crowdstrike 报告疑似单人使用 AI 渗透工具攻击多家韩国银行The Decoder:AI News(RSS)精选82Crowdstrike 报告称,一名疑似中文使用者于2026年9月底至10月初利用 AI 驱动的开源渗透测试工具 ARTEX 攻击多家韩国金融机构,窃取大量数据,其中 Shinhan Bank 超过 25,000 条包含姓名、联系方式、收入和信用额度的记录泄露。
Waymo 完成 50 亿美元债务融资,加速业务扩张Waymo:Blog(网页)精选66Waymo 宣布完成 50 亿美元定期贷款,这是其首次债务融资。PIMCO、Blackstone 和 Sixth Street 担任牵头银团贷方,Goldman Sachs 担任独家主账簿管理人;资金将用于加速其全自动驾驶打车服务在美国及国际市场的扩张。此前今年早些时候 Waymo 完成了 160 亿美元股权融资,上个月刚在第十五个美国城市启动服务。
Codex 与 ChatGPT Work 活跃用户达 4000 万新高,付费账户重置已全部到账Tibo@thsottiaux精选74作者确认 banked reset 已到账所有账户,并转引 Day 3 动态称 Codex 与 ChatGPT Work 合计活跃用户达到 4000 万新高,其中提到 GPT-6 已在 Chat 中上线。
ts-rust 发布:由 LLM 将 TypeScript 编译器、检查器和 LSP 移植到 RustHacker News:AI 热帖精选76ts-rust(tsc-rs)将 microsoft/TypeScript(Go 实现)的编译器、类型检查器和语言服务器移植为 Rust,作者称全部代码由 LLM 编写,本人未读过代码。
OpenAI 在 GitHub 发布 openai/math 仓库,722 份数学手稿引发数学界震荡公众号:数字生命卡兹克精选81OpenAI 于10月7日在 GitHub 发布 openai/math 仓库,收录其未公开内部模型产出的722份数学手稿,归为372个成果组,覆盖数论、代数几何、偏微分方程等方向,每个结果平均花费约3小时 ChatGPT Pro 级别思考算力。
Hugging Face 工程师用 ML Intern 以约 103 美元自制 7 个小模型Hugging Face 官方团队博客精选72Hugging Face 工程师 yuvraj sharma 用 HuggingChat 的 ML Intern 模式在几天内做出 7 个模型,包括可在 CPU 运行、99.7% 有效输出的 0.8B 提示词重写器,以及将柑橘病害识别准确率从 14.9% 提升到 52.8% 的 Qwen3.5-2B 微调模型等,全部计算成本约 103 美元。
Block 如何用 Claude Fable 编排数千个 pull request 的代码迁移Claude:Blog(网页)精选66Anthropic 发表对 Block AI capabilities 负责人 Bradley Axen 的访谈,介绍 Block 用 Claude Fable 5 编排大规模代码迁移:Fable 做数据模型、API 规格等高层设计,再调度数十个更小的 Opus 或 Sonnet 模型执行文件修改和测试,一次迁移可能合并上千个 pull request。
Claude 推出 Dashboards 实时仪表盘与 Motion 动画讲解功能Claude:Blog(网页)精选71Anthropic 发布 Claude Dashboards 和 Claude Motion 两项 beta 功能。
Google 开源 ML Drift 端侧 GPU 推理引擎,接替 TFLite GPU delegateGoogle Developers Blog(RSS)精选70Google AI Edge 团队以 Apache 2.0 许可开源 ML Drift,一个跨平台端侧 GPU 推理计算引擎,作为 LiteRT 的核心 GPU 加速层。
Google 开源 AQuA 环境质量智能体,自动诊断生产环境中的 Agent 故障Google Developers Blog(RSS)精选66Google 发布并开源 AQuA(Ambient Quality Agent),在 Google Cloud 项目中定时从 Cloud Trace、Cloud Logging 或 BigQuery 抽取生产会话,经抽样、评审、聚类、验证、跟踪五阶段流水线诊断 Agent 失败。
OpenAI 封禁俄罗斯与伊朗两个利用 ChatGPT 开展虚假前臆影响行动的账号集群OpenAI:官网动态(RSS · 排除企业/客户案例)精选72OpenAI 封禁了两个隐蔽影响行动,俄罗斯来源的 Dark Clark 通过假 persona Mia Clark 控制拉美智库 Social Research Center,评分达 Category 5,是报告以来首个 Category 5;伊朗来源的 Bogus Bylines 用 7 个假记者身份在全球十几家中小媒体投放近 100 篇长文,评分 Category 4。
GPT-6 Luna Decisions 上架 OpenRouterOpenRouter@OpenRouter精选66OpenRouter 宣布 GPT-6 Luna Decisions 上线。OpenAI 的 Decisions API 可让应用选择合适的模型、工具或动作,支持发送文本、JSON 或图片并返回带概率的类型化答案。定价为输入 $0.10/M、输出免费,上下文 1M;引用 OpenAI 开发者账号称其决策速度比通过 Responses API 的 GPT-6 Luna 最快 10 倍。
LangChain 重构 Deep Agents 的 Skills 支持,新增工具绑定、固定技能与线程内重载LangChain:Blog(RSS)精选60LangChain 重构 Deep Agents 的 Skills 支持,针对企业技能库增至数千个技能的场景推出三项更新:工具可绑定到技能、仅在该技能被读取时加载,用户可通过 /meeting-prep 之类的显式请求固定技能以在首次模型调用前加载,长线程可通过将 skills_metadata 设为 None 重载新增或变更的技能。
NVIDIA 与 Microsoft 推出 RTX Spark 平台并宣布 MXC 让 AI Agent 落地 Windows PCNVIDIA Blog(RSS)精选74NVIDIA 与 Microsoft 在旧金山活动上宣布为 Windows PC 共同打造 AI Agent 软硬件。
Cursor 公布 Claude Haiku 5.5 定价并下调 Claude Sonnet 5.5 缓存读取价格Cursor@cursor_ai精选71Cursor 公布 Claude Haiku 5.5 定价为每 M 输入 token $0.10、输出 token $0.50,输入超过 100k token 时为 $0.50/M 和 $2.50/M。Claude Sonnet 5.5 缓存读取价格也从 $0.20/M 降至 $0.10/M,用户可在 cursor.com/evals 上通过 CursorBench 对比 Haiku 5.5 的表现。
Claude Code v2.1.293 发布:新增 Claude Haiku 5.5 并修复大量问题Claude Code:GitHub Releases(RSS)精选60Claude Code 发布 v2.1.293,新增 Claude Haiku 5.5(claude-haiku-5-5)作为 Anthropic API 默认 Haiku 模型,支持 1M 上下文,价格为 $0.10/$0.50 每百万 token(超 100K 提示为 $0.50/$2.50)。
OpenAI 向全部 ChatGPT 用户推出 GPT-6 与 Intelligent UIOpenAI:官网动态(RSS · 排除企业/客户案例)精选87OpenAI 发布面向更广泛用户的 GPT-6,并随 GPT-6 在 ChatGPT 中引入 Intelligent UI,可生成图形、按钮、表单、图表和可交互组件来回答问题。
Anthropic 推出 Cyber Mission,发布 Critical Infrastructure Defense Program 和 OSS ScannerAnthropic:Newsroom(网页)精选63Anthropic 推出 Anthropic Cyber Mission,长期支持关键基础设施和开源软件的防御方,首期包括 Critical Infrastructure Defense Program(CIDP)和免费的 OSS Scanner。
Anthropic 推出开源漏洞扫描服务 OSS Scanner,免费面向开源项目Anthropic:Research(发表成果 · 网页)精选69Anthropic 发布 OSS Scanner,一个可选加入的开源漏洞扫描服务,用其最强模型(包括 Claude Mythos)定期免费扫描开源项目,输出为全模型生成、无人工复核的报告。
NVIDIA KGMON 团队分享 KDD Cup 2026 数据分析智能体的构建经验NVIDIA Technical Blog:Agentic AI / Generative AI精选62NVIDIA KGMON 团队在 KDD Cup 2026 Data Agents 竞赛获得第二名,并发布构建可靠数据分析智能体的方法复盘。
Anthropic 发布 2026 年使用政策更新,11 月 12 日生效Anthropic:Newsroom(网页)精选61Anthropic 发布新版使用政策,将于 11 月 12 日生效,多数变化是对既有规则的澄清。更新包括新设禁止欺骗性活动章节、收窄选举条款、明确武器软件与无人机武装禁令、更精确的监控与执法限制、补充高风险用例及自主物理操作的 human in the loop 要求,并新增禁止对模型的持续无端虐待行为。
Goodfire 为 Kimi K3 和 GLM 5.3 训练并部署生产级网络安全监控器Goodfire Research(网页)精选72Goodfire Research 为 Kimi K3 和 GLM 5.3 构建基于激活探针加 LLM judge 的监控级联,并部署到生产推理栈。
Tessl 工程博客:AI 不是笨,是瞎——企业级 Agent 记忆的三个关键设计决策Tessl:产品与工程博客精选68作者基于为跨公司工作的 Agent 构建记忆系统一年的经验指出,AI 失败的常见原因不是模型推理差,而是它看不到关键决策上下文,多数 agent memory 只是给瞎子更大的档案柜。
10月7日
Google Research 三个月专利起草实验发现AI辅助未必能培养初级律师的专业判断Google Research:Blog(网页)精选72Google Research 在 NBER 发表的论文报告了一项三个月随机田野实验,向11家知识产权律所的133名律师随机开放当时未发布的 AI 专利写作助手(现属 Gemini Notebook)。
vLLM 详解 DeepSeek-V4.1-Flash 优化:Agent 场景吞吐提升 5 倍vLLM 官方博客(RSS)精选63Inferact 与 vLLM 社区在 DeepSeek-V4.1-Flash 发布三周内完成优化,低并发速度提升 1.9 倍,150 TPS 约束下吞吐提升 5.3 倍。
Google 发布 Developer Knowledge API 生态,为 AI 智能体提供官方文档检索Google Developers Blog(RSS)精选61Google 推出 Developer Knowledge API 生态,作为 Google Cloud、Firebase、Android 等开发者文档的官方程序化来源,用结构化 API 和 Markdown 格式文档取代网页抓取,支持语义与关键词搜索、文档分块和有依据的问答。
Anthropic 发布 Claude Haiku 5.5,Artificial Analysis 评测得分 43Artificial Analysis 完整文章(网页)精选78Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 得 43 分,较上一代 Haiku 一年内提升 26 分,是首个支持 effort 设置与 adaptive thinking 的 Haiku 模型。