Google DeepMind 发布 DiffusionGemma,将现有 Gemma-4-26B-A4B 改造为文本扩散模型,训练 token 预算不到原来的 10%。
AI 动态
模型、产品、Agent、研究,一屏读完高信号变化。
全部 AI 动态
按时间展开的 AI 信息流
当前热点
- 1
- 2
- 3
- 4
- 5
8月9日
Google DeepMind 发布 DiffusionGemma:无需从头训练即可构建文本扩散模型The Decoder:AI News(RSS)60 Pokee AI 发布 Pokee-Isaac 28B:可在客户边界内运行的千万级 token 上下文智能体模型MarkTechPost(RSS)59Pokee AI 发布 Pokee-Isaac 28B,一款 280 亿参数、支持 1000 万 token 上下文的纯文本模型,专为数据不得离开客户边界的受监管行业设计。该模型在 RULER 基准 10M token 长度下得分 93.3%,单张 B200 级 GPU 即可推理,通过 OpenAI 兼容 API 提供并授权 VPC、本地或设备端部署。
8月8日
DeepMind WeatherNext 模型在气旋预报方面取得突破Hacker News 热门(buzzing.cc 中文翻译)45DeepMind 的 WeatherNext 模型在气旋预报上实现突破,相关成果已发布在 deepmind.google。该模型在预测准确率上表现显著,为气象预报领域带来新的进展。
Backflip AI 发布第二代 CAD 生成模型,将 3D 扫描转为可编辑 CAD 模型仅需数分钟The Decoder:AI News(RSS)59Backflip AI 发布第二代 CAD 生成模型,可将 3D 扫描和网格文件转换为完全可编辑的参数化 CAD 模型,耗时从数小时缩短至几分钟。与仅生成三角面网格的早期模型不同,该模型能生成拉伸、旋转等实际 CAD 操作,结果易于修改。工具以 Autodesk Fusion 插件形式运行,前四次重建免费,付费计划每月 20 美元起。
全球第二:马斯克 SpaceXAI 推出 Imagine Image 2.0,强化 AI 生图 / 编辑能力IT之家(RSS)57马斯克旗下 SpaceXAI 今日发布 Imagine Image 2.0 模型,已作为全新质量模式在 Grok.com 网页版及 iOS、安卓应用上线。该模型更遵循指令,能规划文字排版、保持多部分画面一致,并新增魔棒、分割、背景移除、多参考图编辑(最多 5 张)及智能调整尺寸等编辑工具。
Mistral AI 发布 Shieldstral 1.0 3B:开源策略自适应多模态安全分类器,性能媲美 7 倍规模模型MarkTechPost(RSS)69Mistral AI 发布 Shieldstral 1.0 3B,一款开源(Apache 2.0)策略自适应多模态安全分类器,将内容审核简化为单一 yes/no 问题,策略以自然语言写入提示词,无需重新训练。
蚂蚁集团百灵开源 Ling-3.0-flash:124B 总参数、5.1B 激活参数的混合推理模型IT之家(RSS)68蚂蚁集团旗下百灵大模型正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。
8月5日
PRISM2 模型用临床对话解读病理切片Artificial Intelligence News(RSS)40Paige 与微软联合打造的 PRISM2 通过感知器编码器联合训练组织切片与病理报告中的临床对话,将每张切片的数千个切片嵌入聚合为单一表征,进而生成回答诊断问题的文本,而非仅对像素分类。该模型训练数据涵盖 230 万张全切片图像。
8月7日
字节跳动正在训练中国最大AI模型,参数规模达十万亿The Decoder:AI News(RSS)49字节跳动正在训练一个参数规模高达十万亿的AI模型,是当前中国最大模型Moonshot Kimi K3的三倍,与Anthropic顶级系统Mythos 5(行业估计约八万亿参数)处于同一量级。三位知情人士称该模型正处于预训练阶段,通常耗时三到六个月;字节跳动已一年多未使用知识蒸馏。创始人张一鸣已内部要求Seed团队以世界领先的模型能力为长期目标。
蚂蚁百灵开源 Ling-3.0-flash:124B 总参数 MoE 模型,支持 API、单机与高性能三种部署公众号:蚂蚁百灵(Ling)精选75蚂蚁百灵正式开源新一代原生混合推理模型 Ling-3.0-flash,采用 124B 总参数、5.1B 激活参数的 MoE 架构,并提供 FP8、FP4、INT4 等多个版本。
谷歌推出 WeatherNext 气旋模型,AI 高精度预报飓风平均提前 24 小时IT之家(RSS)精选71谷歌 DeepMind 联合多家机构推出 WeatherNext Cyclones 气旋预测模型,在路径、强度和风场结构预测精度上达到业界领先。该模型将有效预报时长从 2 天延长至 3 天,平均提前 24 小时,预测量级约相当于 10 年气象进展。
Neon 携手 Castform 开源 4B 模型:文档搜索能力超 GPT-5.6 Sol,成本仅为 1/100IT之家(RSS)55Neon 与 Castform 联合开源一款经强化学习后训练的 4B 参数模型,在文档搜索任务中平均评估分 1.447,超过 GPT-5.6 Sol 的 1.369 与 GPT-5.4 的 1.377。该模型单次推理成本为 0.000929 美元,约为 GPT-5.6 Sol(0.087338 美元)的 1/100,旨在以更低成本实现智能体式搜索。
Liquid AI 发布 LFM2.5-2.6B:端侧智能体模型,支持工具调用与开放权重MarkTechPost(RSS)64Liquid AI 发布 LFM2.5-2.6B,一款完全在端侧运行的智能体模型,总参数 2.69B,上下文窗口 131,072 token。该模型在 ToolSandbox、Multi-IF 和 IFStruct 等基准上超越 gemma-4-E4B-it 和 Qwen3.5-9B,在 M5 Max 上解码速度达 220 tokens/s。
曝 OpenAI 最快下周推出 Astra 模型,系 GPT-4.5 以来训练的最大模型IT之家(RSS)54消息源爆料称,OpenAI 目标下周发布内部代号为 mewfour 的 Astra 模型,这是其自 GPT-4.5 以来训练的最大全新预训练模型。该模型可组织和协同 AI 智能体,适合长周期、高难度任务,面向更强的推理和协作型工作流。此前有报道称,Astra 一个内部版本已解出 10 个重要开放数学问题,按 Sol API 费率计算所需 token 成本约 2,000 美元。