AI Signals · AI 动态

AI 动态

模型、产品、Agent、研究,一屏读完高信号变化。

All Signals40 条Asia/Shanghai
Timeline

全部 AI 动态

按时间展开的 AI 信息流

AI for Science
ALL SIGNALS40 条
HOT SIGNALS

当前热点

多信源热度 · 随时间消退
  1. 16 个信源同时报道1天前
  2. 24 个信源同时报道13小时前
  3. 33 个信源同时报道1天前
  4. 42 个信源同时报道19小时前
  5. 52 个信源同时报道1天前

8月9日

8月8日

  1. The Decoder:AI News(RSS)
    61
    读者给AI生成的短篇小说打分高于人类作品,直到他们知道作者是机器

    三项实验共2500多名参与者无法区分ChatGPT与人类创作的短篇小说,且对AI文本的质量和沉浸感评分更高(质量均分1.54对0.97,沉浸感1.42对1.00)。但被告知作者是AI后,两类故事的评分均下降;对AI持正面态度的参与者评分更高,持怀疑态度者则相反。研究者认为,AI文本更流畅易读且情绪更积极,这可能解释了高评分,但未必意味着文学上更优。

    • 论文
  2. Ars Technica:AI(RSS)
    精选77
    DeepMind 的 WeatherNext 飓风模型为预报员争取到额外一天预警时间

    Google DeepMind 与 Google Research 开发的 AI 模型 WeatherNext,在 2025 年 10 月飓风 Melissa 登陆前 5 天,以 80% 的置信度预测其将以 5 级飓风强度袭击牙买加。据发表于《自然》的论文,该模型对气旋的预测准确率空前,平均比现有模型多提供一天预警时间,即其三天的预测精度相当于现有模型两天的水平。

    • 论文
  3. IT之家(RSS)
    38
    新 AI 模型 IceBoost v2.0 估算全球冰川蕴冰约 15 万立方千米,融化可抬升海平面 32.3 厘米

    科学家构建 AI 模型 IceBoost v2.0,估算全球冰川约含 15 万立方千米冰,若全部融化(不含南极和格陵兰)将抬升全球平均海平面 32.3 厘米。该模型由威尼斯大学牵头开发,用超 700 万条冰厚测量数据及 26 个物理与几何变量训练,对冰川空间分布的描绘与实地观测匹配度最高提升 40%。研究将支撑 IPCC 冰川评估及淡水供应预测。

    • 论文

8月7日

  1. Apple Machine Learning Research(RSS)
    51
    Arbitrage:利用优势感知投机实现高效推理

    现代大语言模型通过长思维链实现强大推理能力,但推理计算成本高昂。投机解码(Speculative Decoding)用快速但不精确的草稿模型提议 token,再由更强的目标模型并行验证,以加速推理。然而,语义等价步骤中的 token 不匹配会导致不必要的拒绝,传统 token 级投机解码因此受限。

    • 论文
  2. Apple Machine Learning Research(RSS)
    精选64
    扩展分类流映射(Categorical Flow Maps)规模

    连续扩散与流匹配模型有望成为语言建模中自回归方法的有力替代,可解锁加速采样与倾斜等连续模态优势。近期研究通过高斯分布与one-hot编码数据分布间的简单流匹配过程,实现离散数据的连续生成,并借助分类流映射(CFMs)验证了加速采样的可行性,样本质量具有竞争力。

    • 论文
  3. Nathan Lambert@natolambert
    27
    Yichuan Wang

    Zero Train-Inference Mismatch - now for linear attention, and under async RL 🎯 We got bitwise-exact trainer/generator p...

    • 论文
  4. The Decoder:AI News(RSS)
    精选72
    斯坦福与 Arc Institute 用 AI 设计全新病毒基因组,16 种在实验室成功杀死细菌

    斯坦福大学与 Arc Institute 团队用 AI 模型 Evo 从零设计完整病毒基因组,并在实验室构建出 16 种自然界不存在的功能性病毒。Evo 提出 70 万个候选基因组,团队仅筛选最有希望的 285 个序列合成并植入细菌,其中 16 个成功复制并杀死宿主。该研究已通过同行评审发表于《Science》,但 Evo 未接受人类病原体数据训练,且能否推广至其他病毒类群仍是未知数。

    • 论文
  5. IT之家(RSS)
    46
    本源量子与中科大团队破解超导量子计算"速度与保真度"矛盾

    本源量子与中国科学技术大学联合团队提出"参数空间扩展受控相位门(PSE-CZ)"方案,破解超导量子计算速度与保真度相互制约难题,成果发表于《物理评论快报》。在"本源悟空"上对20对两比特量子门测试显示,30-40纳秒极短门长下仍保持优于传统CZ门的稳定性能。该方案还可推广至离子阱、固态自旋等平台。

    • 论文
  6. IT之家(RSS)
    55
    斯坦福团队用 AI 首次设计完整病毒基因组,16 种新型噬菌体可杀死大肠杆菌

    斯坦福大学研究人员使用 AI 技术首次成功设计出完整基因组,产出的 16 种新型噬菌体在实验室中可有效杀死大肠杆菌,不会对人类构成威胁。团队开发的 Evo1 和 Evo2 模型以病毒、细菌、植物和人类的遗传代码为训练数据,通过微调预测"生命语言"。研究被视为"非常重要的转折点",或为抗生素耐药感染提供新治疗路径。

    • 论文
  7. Ars Technica:AI(RSS)
    61
    大型基因组模型被用于设计新病毒

    斯坦福大学研究人员利用大型基因组模型输出可编码功能性蛋白的DNA序列,并成功设计出感染细菌的病毒基因组。这些病毒与现有病毒高度相关,但具备一些难以自然进化出的独特特征。研究者提醒,未来可能出现能设计针对脊椎动物病毒的AI,需提前防范。

    • 论文

8月6日

  1. HuggingFace Daily Papers(社区热门论文)
    51
    KVAE:面向多模态生成模型的 tokenizer 系列

    KVAE 系列 tokenizer 覆盖音频、图像与视频,专为后续文本条件生成设计。其中 KVAE-Audio 为连续全频带 48 kHz tokenizer,具备 50 Hz 潜空间与 64 通道;KVAE-3D 提供 4x16x16 与 4x8x8 两种因果视频压缩方案;KVAE-2D 图像模型实现 8 倍压缩与 32 通道。

    • 论文
  2. HuggingFace Daily Papers(社区热门论文)
    精选71
    Activity Frames:将屏幕活动确定性编译为智能体记忆

    一项研究提出 Activity Frames,用确定性、零模型管线将被动捕获的屏幕活动编译为智能体记忆,输出字节一致、可缓存且可审计。在单人 128,756 帧、51 个活跃天的语料上,该编译器将一天原始捕获压缩为 86 倍更小的提示块,耗时 68 毫秒;智能体阅读该块的问答准确率达 98.4%,优于 LLM 摘要的 66-80%。

    • 论文
  3. HuggingFace Daily Papers(社区热门论文)
    53
    MameLoshnLM:首个开源意第绪语 8B 语言模型与评测基准

    MameLoshnLM 是首个专为意第绪语构建的开源 8B 参数语言模型,基于 Llama 3.1 8B 继续预训练而来。研究同时推出 Oytser 高质量意第绪语预训练语料库和 Kashes 多任务评测基准。在基准任务上,MameLoshnLM 优于同规模开源基线,且更好地捕捉了意第绪语特有的词汇与形态模式。

    • 论文
  4. HuggingFace Daily Papers(社区热门论文)
    38
    TCFM:面向多语言文本嵌入平衡适配的任务条件流匹配

    研究者提出任务条件流匹配(TCFM)框架,针对不同任务采用差异化训练目标:翻译任务使用流匹配,检索、分类等任务则用更契合其学习动态的目标,并结合教师引导与三阶段课程实现稳定适配。在 Indic Massive Text Embedding Benchmark 上,TCFM 取得新 SOTA,并泛化至不同嵌入模型家族,代码与数据集将在论文接收后公开。

    • 论文
  5. HuggingFace Daily Papers(社区热门论文)
    40
    持续学习的范式转变:从参数中心到系统级适应

    持续学习正从参数中心机制转向系统级适应,涵盖训练策略、架构设计及权重适配之外的更广范畴。该综述提出When、How、Where三维框架:How涵盖off-policy、on-policy与超越梯度的优化,When覆盖预训练至推理阶段,Where区分内部参数与外部结构约束,并系统梳理了代表性方法及未来挑战。

    • 论文
  6. HuggingFace Daily Papers(社区热门论文)
    54
    MASS:用权威共享状态构建多人游戏世界模型

    MASS将世界动态与视角渲染解耦,以应对多人环境中现有视频世界模型的计算冗余、视角不一致和扩展性差等问题。其学习型逻辑引擎无需手写转移函数即可推进全局权威类型化状态,渲染引擎则按需为任意相机生成独立且一致的视角。在多人Snake基准上,MASS实现了更高的状态精度和更低的跨视角不一致性,并支持1,024个并发玩家、10,000步循环预测。

    • 论文
  7. HuggingFace Daily Papers(社区热门论文)
    42
    从经济智能体到智能体经济:经济世界模型的系统蓝图

    论文提出经济世界模型(EWM)实施路线图,将其组织为六级能力阶梯,从固定规则智能体世界延伸至与真实观测对齐的仿真-现实经济孪生。系统文献综述显示,现有工作集中于低层级智能体与模拟环境,具备自进化智能体、内生制度与实证对齐的系统仍属罕见。作者发布精选论文列表及相关资源,以加速下一代经济模拟环境开发。

    • 论文
  8. HuggingFace Daily Papers(社区热门论文)
    53
    EffectLearner:面向真实世界视频物体移除的物体-效果推理框架

    EffectLearner 提出一种语义推理增强的视频物体移除框架,结合基于 VLM 的 Object-Effect Reasoner 与基于 DiT 的 Video Eraser,通过结构化效果分析提示词提取效果感知上下文,并引入运动感知掩码引导与运动一致性监督。

    • 论文
  9. HuggingFace Daily Papers(社区热门论文)
    52
    PaDoc:面向文档解析的布局引导并行解码

    PaDoc 将预测布局视为共享页面表示上的分支结构,使布局流与区域内容分支并行推进,将解码深度降至最长布局-内容路径。在 OmniDocBench Full 上,PaDoc 取得 Overall 布局 F1 91.1,端到端解析器中 Overall 得分 94.24,Text Edit 0.038,Formula CDM 95.59。

    • 论文
  10. HuggingFace Daily Papers(社区热门论文)
    56
    EnvACE:通过世界预演内化环境动态的智能体强化学习方法

    EnvACE 提出一种智能体强化学习方法,用世界预演替代训练中的外部环境交互:策略先生成工具调用,再扮演环境生成响应,并基于预演结果继续决策,两端通过任务成功奖励端到端联合优化。

    • 论文
  11. HuggingFace Daily Papers(社区热门论文)
    52
    DyPES-VLA:学习共享动力学先验与具身特定控制,实现跨具身操作

    DyPES-VLA 提出一种跨具身视觉-语言-动作模型,通过未来预测目标训练 VLM 学习共享动力学先验,并利用具身特定的 MoE 动作头直接在原生动作空间生成控制,无需手动对齐异构动作。作为通用策略,它在 LIBERO 上达到 98.0% 成功率,在 RoboCasa-GR1 上为 59.25%,在 RoboTwin 2.0 上为 89.02%,在仿真和真实世界评估中均取得 SOTA 性能。

    • 论文
  12. HuggingFace Daily Papers(社区热门论文)
    49
    HarnessOpt-Bench:评估大语言模型的 Harness 优化能力

    HarnessOpt-Bench 发布,用于在昂贵且随机的评估条件下衡量前沿 LLM 的端到端编排优化能力。优化器需在固定评估预算内编辑目标智能体的 harness 并提名最终候选,最终得分基于在不可访问的测试集上相对 seed 的归一化增益。

    • 论文
  13. HuggingFace Daily Papers(社区热门论文)
    55
    ChronoVision:通过潜在状态重建实现时序推理

    ChronoVision 提出多模态框架,通过监督微调中的 Reconstructive Visual Head 预测最终变换状态的潜在表征,并借助 ROI Attention Locating 模块聚焦关键视觉证据,后训练阶段采用带隐式过程对齐的强化学习。在 Vbvr-VQA 上取得 74.8% 域内和 71.6% 域外准确率,在 IntPhys2 上达到 55.0%。

    • 论文
  14. HuggingFace Daily Papers(社区热门论文)
    43
    UniME-R1:基于失败学习的检索中心思维链统一多模态检索

    UniME-R1 提出一种 embedder-adviser 框架,通过挖掘硬负样本模拟检索失败,让 adviser 基于初始检索结果生成检索中心思维链(RC-CoT),以纠正嵌入器对细微判别线索的混淆。若目标出现在初始 top-k 集合中则直接重排,否则生成 RC-CoT 调整检索方向并执行全库重检索。在 MMEB-V2 及多个通用多模态检索基准上,UniME-R1 持续优于强基线。

    • 论文
  15. HuggingFace Daily Papers(社区热门论文)
    42
    多语言数学推理中的 On-Policy Delta Distillation(OPD2)研究

    一项针对 Qwen3 的研究发现,On-Policy Delta Distillation(OPD2)在多语言数学推理中持续优于原始 OPD,尤其在韩语和日语上提升显著,并普遍缩小了英语与韩语的性能差距。研究还显示,仅用英语数据的 OPD 虽能提升韩语和日语表现,但常使回答偏向英语,凸显了多语言数据对保持目标语言回答的重要性。

    • 论文
  16. HuggingFace Daily Papers(社区热门论文)
    54
    GST-Bench:视频理解中的全局空间智能基准

    GST-Bench 提出用于视频理解全局空间智能的 VQA 基准,含 6,790 分钟合成视频生成的 2,762 个人工验证问题,要求模型从新视角推理并映射到全局俯视图。对 22 个 SOTA VLM 的评估显示,最强零样本模型 Gemini-3-Pro 仅得 42.68 分,远低于人类基线 79.08;研究还提供 GST-Train 数据集以促进后续研究。

    • 论文
  17. HuggingFace Daily Papers(社区热门论文)
    55
    AgentOPSD:面向智能体强化学习的递归自蒸馏方法

    AgentOPSD 提出一种免评论家的递归回合级信用分配方法,将 token 级师生对数概率差聚合为回合级证据,并在 log-odds 空间递归更新贝叶斯信念状态,将稀疏结果监督转化为回合级信用信号。

    • 论文
  18. HuggingFace Daily Papers(社区热门论文)
    52
    CalibForge:用对抗性求解器校准扩展可学习终端任务

    CalibForge 提出一种自主终端任务合成系统,通过多求解器校准和对比校准,将任务构建为受约束的对抗性作者-求解器循环,使候选任务处于可证明可解但未被统一求解的"可学习区"。

    • 论文
  19. Apple Machine Learning Research(RSS)
    40
    DeepAmbigQA:用于评测 LLM 答案完整性的歧义多跳问答基准

    苹果研究团队推出 DeepAmbigQA,一个用于评测大语言模型答案完整性的歧义多跳问答基准。该基准聚焦"同名电影《盗火线》中哪位演员获得过奥斯卡奖"这类复杂问题,要求模型同时区分同名实体并跨大量实体进行多跳推理。研究团队还发布了自动数据生成流程 DEEPAMBIGQAGEN,以构建此类评测数据。

    • 论文