AI Signals · AI 动态

AI 动态

模型、产品、Agent、研究,一屏读完高信号变化。

Selected Signals17 条Asia/Shanghai
Timeline

精选

高信号更新流

AI for Science
SELECTED17 条
HOT SIGNALS

当前热点

多信源热度 · 随时间消退
  1. 113 个信源同时报道10小时前
  2. 27 个信源同时报道3小时前
  3. 310 个信源同时报道1天前
  4. 45 个信源同时报道11小时前
  5. 56 个信源同时报道6小时前

10月9日

10月7日

10月8日

  1. Aravind Srinivas(Perplexity CEO)@AravSrinivas
    精选65
    Perplexity 开源 pplx-embed-v2-late 多模态 late-interaction 嵌入模型(9B 与 0.6B)

    Perplexity 开源 pplx-embed-v2-late,两个针对文本和图像的 late-interaction 多向量嵌入模型,大小为 9B 和 0.6B,共享同一嵌入空间,权重已在 Hugging Face 提供。9B 可用于索引多模态数据,0.6B 可在设备端查询,无需 OCR 即可检索 PDF 页面;模型在 MADQA 得分 92.4%,BrowseComp+ 得分 64%。

    • 模型

10月6日

  1. ARC Prize@arcprize
    精选67
    DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 评测中的成绩公布

    ARC Prize 公布 DeepSeek V4.1 Flash 在 ARC-AGI (Verified) 的成绩:ARC-AGI-2 得分 72.9%,每任务成本 $0.13;ARC-AGI-1 得分 94.5%,每任务成本 $0.07。相比 V4 Flash 的最佳成绩,ARC-AGI-1 高 5.5 分,ARC-AGI-2 高 11.5 分,但每任务成本高约 250%。

    • 模型
  2. Arena@arena
    精选67
    Mistral Large 4 上线 Arena 的 Agent Arena 与 Code Arena 评测

    Arena 宣布 Mistral 的 Mistral Large 4 现已进入 Agent Arena,用户可前往测试投票,分数稍后公布。该模型为 1T 参数、49B 激活的原生多模态开放权重模型,也已在 Code Arena 的 WebDev、Text 和 Vision 中可用。

    • 模型

10月5日

10月3日

  1. Arena@arena
    精选69
    Arena 评测:Claude Sonnet 5.5 登顶 Agent Arena 第 3 名但未入 Pareto 前沿

    Arena 发布 Agent Arena 最新榜单,Anthropic 的 Claude Sonnet 5.5 以 +12.5% 净提升得分排名第 3,单任务中位成本 $2.74,比排名第 2 的 Claude Opus 5.5($1.58)高约 73%,且 Opus 5.5 得分更高,因此 Sonnet 5.5 未进入 Agent Arena 的 Pareto 前沿。据引用内容,Sonnet 5.5 在 Chat 类目以 +15.6% 排名第 1,Anthropic 模型包揽 Agent Arena 前三名。

    • 模型

10月2日

  1. Ai2 / Allen Institute for AI(RSS)
    精选62
    Ai2 开源 8B 科学报告生成模型 AstaBrief

    Ai2 开源 AstaBrief 8B,一个基于 Qwen3-8B、将研究问题和检索文献片段转化为带引用报告的科学报告生成模型,现已在 Asta 的 Generate a report 功能中作为 Fast mode 上线,并连同训练数据开放下载。

    • 模型