Liquid AI 于 10 月 7 日发布博文,推出开放权重决策模型 d1-3B(31.2 亿参数,支持文本与图像输入)和 d1-omni-600M(5.87 亿参数,支持文本、图像及语音输入),已在 Hugging Face 公开,可下载、微调并部署。
AI 动态
模型、产品、Agent、研究,一屏读完高信号变化。
全部 AI 动态
按时间展开的 AI 信息流
当前热点
- 1
- 2
- 3
- 4
- 5
10月9日
Liquid AI 开源 d1 系列决策模型:d1-3B 单次判断仅 8 毫秒,支持图像输入IT之家·人工智能56 JetBrains 编程 AI 模型 Mellum2.1 发布:高负载推理吞吐量近 Qwen3.5-9B 两倍IT之家·人工智能50JetBrains 发布编程 AI 模型 Mellum2.1,延续 Mellum2 的 12B 混合专家架构、2.5B 活跃参数,仍以 Apache 2.0 许可证开源,重点增强智能体编程能力。
Mistral Large 4 进入 Agent Arena 前十五实验室,排名第 43Arena@arena精选71Arena 宣布 Mistral Large 4 进入 Agent Arena 前十五实验室,基于超 5000 个真实智能体会话,该预览版净改进分为 -6.6%,总排名第 43,比前代 Mistral Medium 3.5(-12.60%)高出 11 位。
MiniMax H3 开源视频世界模型物理评测MiniMax@MiniMax_AI49在物理方面,谁拥有最好的开源视频世界模型?💫 又是我,MiniMax H3。几乎与闭源 sota 持平。🍾
Artificial Analysis 评测 Grok Imagine Video 1.5 Lite:登 AA-Video-T2V v2.0 榜第 17 名并进入质量速度 Pareto 前沿Artificial Analysis@ArtificialAnlys60Artificial Analysis 评测 SpaceXAI 新发布的低价视频模型 Grok Imagine Video 1.5 Lite,其在 AA-Video-T2V v2.0 和 AA-Video-T2V-Silent v2.0 两个榜单均排第 17 名,价格约为 Veo 3.1 的三分之一并排在 Veo 3.1 之前。
Arena 公布 Claude Haiku 5.5 (High) 真实评测结果:Code Arena 1587 分首秀第 30 名Arena@arena精选71Arena 公布 Anthropic Claude Haiku 5.5 (High) 的真实评测结果,在 Code Arena: WebDev 以 1587 分首秀排名第 30,略在 Pareto 前沿之外。
Artificial Analysis 网络指数新增可信访问模型,GPT-6 Sol 登顶Artificial Analysis@ArtificialAnlys40Artificial Analysis 网络指数新增可信访问模型类别,GPT-6 Sol(Daybreak Blue, max)以领先成绩登顶,并进入成本与能力帕累托前沿。该模型在整个指数测试中未触发任何安全拦截,总分较公开版 GPT-6 Sol(max)提升 32 分。其每任务成本为 $1.77,低于 Grok 4.7(xhigh)的 $11.67。
Grok 4.7 在 Harvey 法律智能体基准上以 9.4% 幻觉门控通过率居首Elon Musk@elonmusk, xAI51Artificial Analysis 与 Harvey 合作发布 Harvey LAB-AA v1.1,新指标 Hallucination-Gated All-Pass Rate 要求交付物无重大幻觉。Grok 4.7 (xhigh) 以 9.4% 居首,领先 Muse Spark 1.3 (max) 的 8.9% 和 GPT-6 Astra (max) 的 8.6%;测试模型中超过 60% 的原通过结果含重大幻觉。Grok 4.7 每任务约 $9.50,GPT-6 Astra 每任务平均仅 0.03 次重大幻觉。
阶跃星辰 Step 5 Preview 现身 OpenRouter,1M 上下文 MoE 模型Hacker News:AI 热帖38阶跃星辰的 Step 5 Preview 已在 OpenRouter 上线,这是一款 1M 上下文的 MoE 模型。该系列此前的 Step 3.7 Flash 采用 196B 参数语言主干加视觉编码器,每 token 激活约 11B 参数,支持 256K 上下文和 high/medium/low 可选推理等级,面向编程、智能体工作流与结构化输出。
OpenAI 推出 GPT-6.1 Sol Ultrafast,速度最高快 8 倍Vaibhav Srivastav(OpenAI)@reach_vb55OpenAI 宣布 GPT-6.1 Sol Ultrafast 开始推出,token 生成速度最高比 Sol Standard 快 8 倍。API 定价为每 100 万输入 token $12、每 100 万输出 token $60,该模型已在 API、Codex 和 ChatGPT Work 中推出。
GPT-6.1 Sol Ultrafast 成本仅 Astra 1.2 倍Vaibhav Srivastav(OpenAI)@reach_vb45顺便说一句,成本只是 Astra 的 1.2 倍。
OpenAI GPT-6.1 Sol Ultrafast 在 ChatGPT Work、Codex 和 API 推出Testing Catalog@testingcatalog59OpenAI 的 GPT-6.1 Sol Ultrafast 正在 ChatGPT Work、Codex 和 API 上推出。Ultrafast 模式定价为每百万输入 token $12、每百万输出 token $60,速度比 Sol Standard 快 8 倍。
Harvey LAB-AA v1.1 引入幻觉门控评分Artificial Analysis@ArtificialAnlys49Artificial Analysis 与 Harvey 联合发布 Harvey LAB-AA v1.1,为法律智能体基准 LAB 新增幻觉检查,要求正确回答不含重大错误陈述,并推出新指标 Hallucination-Gated All-Pass Rate。
Odyssey 发布世界基础模型 Odyssey-3 并开放研究预览Testing Catalog@testingcatalog63Odyssey 发布其最强世界基础模型 Odyssey-3,并向公众开放免费研究预览。模型可从提示词构建环境并实时预测随人物移动或事件触发的变化;Odyssey-3 Pro 在 Physics-IQ Verified video-to-video(best-of-8 采样)上得分 66.1,为已报告最高结果。
Generalist 的 GEN-1.5 连续装箱演示Generalist@GeneralistAI32GEN-1.5 把一个瓶子装进盒子,再把另一个瓶子装进盒子,再一个瓶子,再一个,再一个…… 阅读更多关于 GEN-1.5 的内容,请见下方评论中的博客文章。
Odyssey 发布世界模型 Odyssey-3,Pro 版 Physics-IQ Verified 视频生成得分 66.1Rohan Paul@rohanpaul_ai60Odyssey 发布基础世界模型 Odyssey-3,Pro 版报告了 Physics-IQ Verified video-to-video 最高分 66.1。
Odyssey-3 世界模型发布Odyssey@odysseyml46今天我们推出 Odyssey-3,迄今最强大的基础世界模型。 它在 Physics-IQ 上创下新的 SOTA,可驱动机器人、训练 AI,并生成交互式体验。真的很酷。 今天即可体验该模型,完全免费!
Artificial Analysis 评测 Google Nano Banana 2.1,两榜居第 4 且价格为前代一半Artificial Analysis@ArtificialAnlys精选75Artificial Analysis 评测 Google 于 10 月 6 日发布的图像模型 Nano Banana 2.1,在 AA-Image-T2I v2.0 和 AA-Image-Editing v2.0 两个榜单均排名第 4。
Perplexity Decider 登顶 DecisionBenchAravind Srinivas(Perplexity CEO)@AravSrinivas40Perplexity Decider 在 DecisionBench 上排名第一(成本也是最低的)
JetBrains 发布 Mellum2.1:面向编码 Agent 的 12B MoE 开源模型MarkTechPost(RSS)62JetBrains 发布面向编码 Agent 的开源思考模型 Mellum2.1(checkpoint 为 Mellum2.1-12B-A2.5B-Thinking),总参数 12B、每 token 激活 2.5B,以 Apache 2.0 协议上架 Hugging Face。
10月8日
Artificial Analysis Cyber Index 引入 trusted-access 模型,GPT-6 Sol (Daybreak Blue) 登顶Artificial Analysis 完整文章(网页)51Artificial Analysis 将 Cyber Index 排行榜扩展至非公开访问的 trusted-access 模型,首个纳入的 GPT-6 Sol (Daybreak Blue, max) 目前登顶,仅可通过 OpenAI 的 Daybreak 项目使用。
Harvey LAB-AA v1.1 发布:为智能体法律工作加入幻觉检查Artificial Analysis 完整文章(网页)34Harvey LAB-AA v1.1 新增幻觉检查,将幻觉分为矛盾源材料、捏造源内容和无记录支持的具体断言三类,并区分重大与轻微,仅重大幻觉会触发 Hallucination-Gated All-Pass Rate 清零。
Hugging Face 联创 Thomas Wolf 发布开源基因注释模型 Carbon-A 及 5.66 亿候选基因数据库Thomas Wolf(Hugging Face 联创/CSO)@Thom_Wolf59Thomas Wolf 团队发布开源模型 Carbon-A,直接在 DNA 中定位基因,并据此构建覆盖 22617 个物种、共 5.66 亿候选基因的 Carbon Annotation Database。模型与数据库一并开放,团队与 Active Site 和 UCSD 合作在猫、鸡和拟南芥等物种中完成部分新基因的湿实验验证,并找到 239 个参考注释中缺失的 RNA 证据基因。
Perplexity 开源临床决策模型Aravind Srinivas(Perplexity CEO)@AravSrinivas47perplexity 的开源权重决策模型,临床决策质量最佳、成本最低
OpenRouter 测 GPT-6 Luna 决策速度OpenRouter@OpenRouter20GPT-6 Luna 是当下最快的 Decisions 模型,全球请求延迟 180ms 🏁 紧随其后的是 Jev 和 Perplexity Decider:
Step 5 Preview 八项基准六胜 Kimi K3OpenRouter@OpenRouter50在 StepFun 的 8 项基准评测中,Step 5 Preview 在 6 项上击败 Kimi K3 和 GLM-5.3,包括 DeepSWE(67.7)、ProgramBench(80.5)、StepCodeBench(49.0)和 FrontierFinance(66.4)。
阶跃星辰 Step 5 Preview 上线 OpenRouter,开放一周免费试用阶跃星辰 StepFun@StepFun_ai54阶跃星辰(StepFun)宣布 Step 5 Preview 现已上线 OpenRouter,链接为 https://openrouter.ai/stepfun/step-5-preview。即日起在 @opencode、@cline、@NousResearch、@kilocode 等平台陆续开放一周免费访问,主打智能体与专业工作场景,任务成本明显更低,用户可保留现有工作流直接切换模型。
阶跃星辰发布 Step 5 Preview阶跃星辰 StepFun@StepFun_ai51阶跃星辰官方发布 Step 5 Preview 的介绍入口,提供模型概览、评测基准与演示页面,以及技术规格和 API 文档。详情见 https://www.stepfun.com/step-5-preview 与 https://platform.stepfun.ai/docs/en/guides/models/step-5-preview。
Understanding AI 解读新模型 Jev:只输出概率的新形态 AI 为何爆红Timothy B. Lee:Understanding AI(RSS)67TypeSafe AI 于 9 月 15 日发布的模型 Jev 走红,公告获近 4000 万浏览,一周内超 10 万人加入其 Discord,GitHub 上约 2000 个项目使用。
Claude Haiku 5.5 发布:成本比 Haiku 4.5 低约 75%,benchmark 对比 GPT-6 Luna 领先邵猛@shao__meng66Anthropic 发布 Claude Haiku 5.5,官方称这是其推出的最便宜、最快、能力最强的小模型,运行成本平均比 Claude Haiku 4.5 低约 75%。作者称其 benchmark 全面领先 GPT-6 Luna,OpenRouter 观测的 token 输出速度约为 2 倍,并观察到不少用户正从 CodeX 迁移到 Claude Code。
蚂蚁百灵 Ling-3.1-Flash 登陆 OpenRouter蚂蚁百灵@AntLingAGI43感谢我们的 day0 合作伙伴 @novita_labs 持续、可靠的发布支持 🥰 @novita_labs:🚀 来自 @AntLingAGI 的 Ling-3.1-Flash 现已通过 Novita 在 @OpenRouter 上线。 作为 Day-0 合作伙伴发布 ⚡ 🎁 10 月 13 日上午 9:00(PT)前免费。 560B 总参数 · 25B 激活参数。 专为混合推理和工具调用工作流打造。
Perplexity 发布 pplx-embed-v2-late:0.6B 边缘模型与 9B 模型,MADQA 得分 92.4%MarkTechPost(RSS)48Perplexity 发布 ColBERT 式多模态嵌入模型 pplx-embed-v2-late,含 0.6B 与 9B 两个版本,9B 在 MADQA 上取得 92.4% 的最佳成绩,0.6B 则面向边缘设备与本地查询编码。
生数科技发布 Vidu Q4 Preview 视频生成模型预览版,支持 3 段参考音频与 2K/4K 输出公众号:生数科技(Vidu·视频)60生数科技发布全新视频生成旗舰模型 Vidu Q4 的预览版 Vidu Q4 Preview,主打人物演技、镜头语言与特效表现力。新版本最多支持 3 段参考音频和 15 张参考图,支持 2K、4K 输出与 10bit 色深,首发优惠价 0.09 元/秒起,官方称同样预算约 5 倍出片,并从 Day 1 起面向全球创作者开放。
PFN 发布 PLaMo 3 Translate 31B 翻译模型:日语翻译表现优于 GPT-6.1 SolIT之家·人工智能44日本企业 Preferred Networks 发布翻译模型 PLaMo 3 Translate 31B,完全由日本自主研发,训练数据中日语占比约 30%。该模型基于 PLaMo 3,支持语言从 2 种扩展至 53 种,并引入覆盖 15 种语言的在线会议翻译模式。
Anthropic 发布 Claude Haiku 5.5:1M 上下文,输入每百万 token 0.10 美元MarkTechPost(RSS)77Anthropic 发布 Claude Haiku 5.5,为目前最便宜最快的小模型,1M 上下文窗口、最高 128K 输出,10 万 token 以内输入每百万 0.10 美元、输出 0.50 美元,比 Haiku 4.5 低约 90%。
Vidu Q4 Preview 登上 Artificial Analysis AA-Video-I2V v1.0 榜单第 3 名,较 Vidu Q3 Pro 的第 19 名大幅提升Artificial Analysis@ArtificialAnlys58Vidu Q4 Preview 首次进入 Artificial Analysis AA-Video-I2V v1.0 排行榜第 3 名,比 Vidu Q3 Pro 上升 16 位。
Claude Haiku 5.5 降价 90%Oran Ge@oran_ge42A 社发善心,Claude Haiku 5.5 降价 90%,价格对齐 GPT 6 Luna 能力方面非常能打。。。 这可能是最佳性价比模型
Arena 评测 Jev Router:成本高 38%、延迟 1.7 倍Arena@arena37Arena 在 Agent Arena 上用超 4700 个真实智能体会话评测了 typesafeai 的 Jev Router,结果显示其未推进当前帕累托前沿:达到与 DeepSeek V4.1 Flash(Max)相近性能时成本高 38%,模型请求延迟中位数高 1.7 倍。
OpenAI 面向所有 ChatGPT 用户推出 GPT-6 系列模型和智能用户界面IT之家·人工智能76OpenAI 于 10 月 8 日宣布面向所有 ChatGPT 用户推出 GPT-6 系列模型和智能用户界面(Intelligent UI),ChatGPT 全球周活跃用户超过 12 亿,此前停留在 GPT-5.6 系列。
10月7日
Anthropic 发布 Claude Haiku 5.5,Artificial Analysis 评测得分 43Artificial Analysis 完整文章(网页)精选78Anthropic 发布 Claude Haiku 5.5,在 Artificial Analysis Intelligence Index 得 43 分,较上一代 Haiku 一年内提升 26 分,是首个支持 effort 设置与 adaptive thinking 的 Haiku 模型。