Arena 宣布 Mistral Large 4 进入 Agent Arena 前十五实验室,基于超 5000 个真实智能体会话,该预览版净改进分为 -6.6%,总排名第 43,比前代 Mistral Medium 3.5(-12.60%)高出 11 位。
AI 动态
模型、产品、Agent、研究,一屏读完高信号变化。
精选
高信号更新流
当前热点
- 1
- 2
- 3
- 4
- 5
10月9日
Mistral Large 4 进入 Agent Arena 前十五实验室,排名第 43Arena@arena精选71 Arena 公布 Claude Haiku 5.5 (High) 真实评测结果:Code Arena 1587 分首秀第 30 名Arena@arena精选71Arena 公布 Anthropic Claude Haiku 5.5 (High) 的真实评测结果,在 Code Arena: WebDev 以 1587 分首秀排名第 30,略在 Pareto 前沿之外。
Artificial Analysis 评测 Google Nano Banana 2.1,两榜居第 4 且价格为前代一半Artificial Analysis@ArtificialAnlys精选75Artificial Analysis 评测 Google 于 10 月 6 日发布的图像模型 Nano Banana 2.1,在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 两个榜单均排名第 4。
10月7日
Anthropic 发布 Claude Haiku 5.5,Artificial Analysis 评测得分 43Artificial Analysis 完整文章(网页)精选78Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 得 43 分,较上一代 Haiku 一年内提升 26 分,是首个支持 effort 设置与 adaptive thinking 的 Haiku 模型。
Anthropic 发布 Claude Haiku 5.5,运行成本平均降低约 75%Anthropic:Newsroom(网页)精选78Anthropic 发布 Claude Haiku 5.5,定位为迄今最便宜、最快的小模型,适合摘要、压缩、数据库查询、分类等高吞吐任务,并可搭配 Opus 5.5 和 Sonnet 5.5 担任编码子智能体。
Liquid AI 发布开源决策模型 d1-3B 和 d1-omni-600MLiquid AI 模型与工程博客(网页)精选61Liquid AI 发布开源权重决策模型 d1-3B 和 d1-omni-600M,已在 Hugging Face 上提供。
Mistral Large 4 进入 Code Arena: WebDev 排名第45,得分1534Arena@arena精选68Arena 宣布 Mistral Large 4 登陆 Code Arena: WebDev,以 1534 分排名第 45,比 Mistral Large 3(第130名)高 304 分,比 Mistral Medium 3.5 高 271 分。
Google DeepMind 发布开源轻量多模态嵌入模型 EmbeddingGemma 2Google DeepMind:Blog(RSS)精选70Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,以 Apache 2.0 许可开源,将文本、代码、图像、视频和音频映射到统一嵌入空间。
10月8日
Perplexity 开源 pplx-embed-v2-late 多模态 late-interaction 嵌入模型(9B 与 0.6B)Aravind Srinivas(Perplexity CEO)@AravSrinivas精选65Perplexity 开源 pplx-embed-v2-late,两个针对文本和图像的 late-interaction 多向量嵌入模型,大小为 9B 和 0.6B,共享同一嵌入空间,权重已在 Hugging Face 提供。9B 可用于索引多模态数据,0.6B 可在设备端查询,无需 OCR 即可检索 PDF 页面;模型在 MADQA 得分 92.4%,BrowseComp+ 得分 64%。
10月6日
Gemini Nano Banana 2.1 图像生成模型正式发布,gemini-3.1-flash-image 被弃用Gemini API:更新日志(网页)精选68Google 在 Gemini API 更新日志中宣布 Gemini Nano Banana 2.1(gemini-nano-banana-2.1)正式可用,作为 Nano Banana 2(gemini-3.1-flash-image)的更新版本。
DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 评测中的成绩公布ARC Prize@arcprize精选67ARC Prize 公布 DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 的成绩:ARC-AGI-2 得分 72.9%,每任务成本 $0.13;ARC-AGI-1 得分 94.5%,每任务成本 $0.07。相比 V4 Flash 的最佳成绩,ARC-AGI-1 高 5.5 分,ARC-AGI-2 高 11.5 分,但每任务成本高约 250%。
Mistral Large 4 上线 Arena 的 Agent Arena 与 Code Arena 评测Arena@arena精选67Arena 宣布 Mistral 的 Mistral Large 4 现已进入 Agent Arena,用户可前往测试投票,分数稍后公布。该模型为 1T 参数、49B 激活的原生多模态开放权重模型,也已在 Code Arena 的 WebDev、Text 和 Vision 中可用。
Mistral 发布 Mistral Large 4,Artificial Analysis 评测称其为美中之外最智能模型Artificial Analysis 完整文章(网页)精选66Mistral 发布 Mistral Large 4(Research Public Preview),在 Artificial Analysis Intelligence Index 得分 38,与 GPT-6 Luna(max, 38)相当,为美中之外最智能模型,计划 10 月底开源 1T 参数(49B 激活)权重。
10月5日
Liquid AI 发布 d1 决策模型并新增图像输入能力Liquid AI 模型与工程博客(网页)精选69Liquid AI 发布 d1 决策模型,新增文本与图像输入,可通过 console.liquid.ai 和 d1 Playground 使用。
10月3日
GPT-6.1 Sol (Max) 进入 Agent Arena 第 5 名,以更低成本逼近前列模型Arena@arena精选73Arena 宣布 OpenAI 的 GPT-6.1 Sol (Max) 在 Agent Arena 排名第 5(+11.23%),中位任务成本 $0.56,并重塑了 Pareto 前沿。
Arena 评测:Claude Sonnet 5.5 登顶 Agent Arena 第 3 名但未入 Pareto 前沿Arena@arena精选69Arena 发布 Agent Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升得分排名第 3,单任务中位成本 $2.74,比排名第 2 的 Claude Opus 5.5($1.58)高约 73%,且 Opus 5.5 得分更高,因此 Sonnet 5.5 未进入 Agent Arena 的 Pareto 前沿。据引用内容,Sonnet 5.5 在 Chat 类目以 +15.6% 排名第 1,Anthropic 模型包揽 Agent Arena 前三名。
10月2日
Ai2 开源 8B 科学报告生成模型 AstaBriefAi2 / Allen Institute for AI(RSS)精选62Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据开放下载。