AI Signals · AI 动态

AI 动态

模型、产品、Agent、研究,一屏读完高信号变化。

All Signals27 条Asia/Shanghai
Timeline

全部 AI 动态

按时间展开的 AI 信息流

AI for Science
ALL SIGNALS27 条
HOT SIGNALS

当前热点

多信源热度 · 随时间消退
  1. 113 个信源同时报道12小时前
  2. 27 个信源同时报道5小时前
  3. 310 个信源同时报道1天前
  4. 45 个信源同时报道13小时前
  5. 57 个信源同时报道1小时前

10月9日

  1. Artificial Analysis@ArtificialAnlys
    40
    Artificial Analysis 网络指数新增可信访问模型,GPT-6 Sol 登顶

    Artificial Analysis 网络指数新增可信访问模型类别,GPT-6 Sol(Daybreak Blue, max)以领先成绩登顶,并进入成本与能力帕累托前沿。该模型在整个指数测试中未触发任何安全拦截,总分较公开版 GPT-6 Sol(max)提升 32 分。其每任务成本为 $1.77,低于 Grok 4.7(xhigh)的 $11.67。

    • 模型
  2. Elon Musk@elonmusk, xAI
    51
    Grok 4.7 在 Harvey 法律智能体基准上以 9.4% 幻觉门控通过率居首

    Artificial Analysis 与 Harvey 合作发布 Harvey LAB-AA v1.1,新指标 Hallucination-Gated All-Pass Rate 要求交付物无重大幻觉。Grok 4.7 (xhigh) 以 9.4% 居首,领先 Muse Spark 1.3 (max) 的 8.9% 和 GPT-6 Astra (max) 的 8.6%;测试模型中超过 60% 的原通过结果含重大幻觉。Grok 4.7 每任务约 $9.50,GPT-6 Astra 每任务平均仅 0.03 次重大幻觉。

    • 模型
  3. Vaibhav Srivastav(OpenAI)@reach_vb
    55
    OpenAI 推出 GPT-6.1 Sol Ultrafast,速度最高快 8 倍

    OpenAI 宣布 GPT-6.1 Sol Ultrafast 开始推出,token 生成速度最高比 Sol Standard 快 8 倍。API 定价为每 100 万输入 token $12、每 100 万输出 token $60,该模型已在 API、Codex 和 ChatGPT Work 中推出。

    • 模型
  4. Artificial Analysis@ArtificialAnlys
    49
    Harvey LAB-AA v1.1 引入幻觉门控评分

    Artificial Analysis 与 Harvey 联合发布 Harvey LAB-AA v1.1,为法律智能体基准 LAB 新增幻觉检查,要求正确回答不含重大错误陈述,并推出新指标 Hallucination-Gated All-Pass Rate。

    • 模型
  5. Testing Catalog@testingcatalog
    63
    Odyssey 发布世界基础模型 Odyssey-3 并开放研究预览

    Odyssey 发布其最强世界基础模型 Odyssey-3,并向公众开放免费研究预览。模型可从提示词构建环境并实时预测随人物移动或事件触发的变化;Odyssey-3 Pro 在 Physics-IQ Verified video-to-video(best-of-8 采样)上得分 66.1,为已报告最高结果。

    • 模型
  6. Generalist@GeneralistAI
    32
    Generalist 的 GEN-1.5 连续装箱演示

    GEN-1.5 把一个瓶子装进盒子,再把另一个瓶子装进盒子,再一个瓶子,再一个,再一个…… 阅读更多关于 GEN-1.5 的内容,请见下方评论中的博客文章。

    • 模型
  7. Odyssey@odysseyml
    46
    Odyssey-3 世界模型发布

    今天我们推出 Odyssey-3,迄今最强大的基础世界模型。 它在 Physics-IQ 上创下新的 SOTA,可驱动机器人、训练 AI,并生成交互式体验。真的很酷。 今天即可体验该模型,完全免费!

    • 模型

10月8日

  1. Thomas Wolf(Hugging Face 联创/CSO)@Thom_Wolf
    59
    Hugging Face 联创 Thomas Wolf 发布开源基因注释模型 Carbon-A 及 5.66 亿候选基因数据库

    Thomas Wolf 团队发布开源模型 Carbon-A,直接在 DNA 中定位基因,并据此构建覆盖 22617 个物种、共 5.66 亿候选基因的 Carbon Annotation Database。模型与数据库一并开放,团队与 Active Site 和 UCSD 合作在猫、鸡和拟南芥等物种中完成部分新基因的湿实验验证,并找到 239 个参考注释中缺失的 RNA 证据基因。

    • 模型
  2. OpenRouter@OpenRouter
    20
    OpenRouter 测 GPT-6 Luna 决策速度

    GPT-6 Luna 是当下最快的 Decisions 模型,全球请求延迟 180ms 🏁 紧随其后的是 Jev 和 Perplexity Decider:

    • 模型
  3. OpenRouter@OpenRouter
    50
    Step 5 Preview 八项基准六胜 Kimi K3

    在 StepFun 的 8 项基准评测中,Step 5 Preview 在 6 项上击败 Kimi K3 和 GLM-5.3,包括 DeepSWE(67.7)、ProgramBench(80.5)、StepCodeBench(49.0)和 FrontierFinance(66.4)。

    • 模型
  4. 阶跃星辰 StepFun@StepFun_ai
    54
    阶跃星辰 Step 5 Preview 上线 OpenRouter,开放一周免费试用

    阶跃星辰(StepFun)宣布 Step 5 Preview 现已上线 OpenRouter,链接为 https://openrouter.ai/stepfun/step-5-preview。即日起在 @opencode、@cline、@NousResearch、@kilocode 等平台陆续开放一周免费访问,主打智能体与专业工作场景,任务成本明显更低,用户可保留现有工作流直接切换模型。

    • 模型
  5. 阶跃星辰 StepFun@StepFun_ai
    51
    阶跃星辰发布 Step 5 Preview

    阶跃星辰官方发布 Step 5 Preview 的介绍入口,提供模型概览、评测基准与演示页面,以及技术规格和 API 文档。详情见 https://www.stepfun.com/step-5-preview 与 https://platform.stepfun.ai/docs/en/guides/models/step-5-preview。

    • 模型
  6. 蚂蚁百灵@AntLingAGI
    43
    蚂蚁百灵 Ling-3.1-Flash 登陆 OpenRouter

    感谢我们的 day0 合作伙伴 @novita_labs 持续、可靠的发布支持 🥰 @novita_labs:🚀 来自 @AntLingAGI 的 Ling-3.1-Flash 现已通过 Novita 在 @OpenRouter 上线。 作为 Day-0 合作伙伴发布 ⚡ 🎁 10 月 13 日上午 9:00(PT)前免费。 560B 总参数 · 25B 激活参数。 专为混合推理和工具调用工作流打造。

    • 模型
  7. Oran Ge@oran_ge
    42
    Claude Haiku 5.5 降价 90%

    A 社发善心,Claude Haiku 5.5 降价 90%,价格对齐 GPT 6 Luna 能力方面非常能打。。。 这可能是最佳性价比模型

    • 模型
  8. Arena@arena
    37
    Arena 评测 Jev Router:成本高 38%、延迟 1.7 倍

    Arena 在 Agent Arena 上用超 4700 个真实智能体会话评测了 typesafeai 的 Jev Router,结果显示其未推进当前帕累托前沿:达到与 DeepSeek V4.1 Flash(Max)相近性能时成本高 38%,模型请求延迟中位数高 1.7 倍。

    • 模型