StepFun 发布面向智能体工作的新旗舰模型 Step 5 Preview,为稀疏 MoE 架构,总参数约 600B、每 token 激活约 27B,支持 1M token 上下文和文本、图像、视频输入,API 定价为每 1M 输入 token $1.00、输出 $2.70。
AI Pulse
Models, products, agents, research — read the high-signal changes in a single screen.
All Signals
An AI feed unfolding by time
Current Hotspots
- 1
- 2
- 3
- 4
- 5
9月21日
阶跃星辰发布 Step 5 Preview:600B 总参 27B 激活的 MoE 模型,支持 1M 上下文MarkTechPost(RSS)70 阿里云 Qwen 团队发布 Qwen-Image-2.1 图像生成模型并开放权重,定位为 Qwen-Image 系列中最均衡、高性价比的版本,统一支持生成与编辑。Alibaba Cloud@alibaba_cloud69 通义千问发布 Qwen-Image-2.1,一个 7B 参数的原生图像生成与编辑模型,生成和编辑共用单一检查点,最多支持 10 张参考图。模型自带提示词增强 LLM,已集成 diffusers 和 ComfyUI,并在 Hugging Face Spaces 提供免安装的浏览器在线 demo:https://huggingface.co/spaces/hugging-apps/qwen-image-2-1Qwen@Alibaba_QwenSelected69Hugging AppsQwen Image 2.1 来了!🖼️ 一个 7B params 的原生图像生成与编辑模型,最多支持 10 张图像参考 该模型自带提示词增强 LLM,已集成 diffusers 🧨 和 ComfyUI ▶️ 在 Spaces 上体验 ...
阿里 Qwen 团队发布开源权重图像生成模型 Qwen-Image-2.1,仅 7B 参数The Decoder:AI News(RSS)70阿里 Qwen 团队发布开源权重图像生成与编辑模型 Qwen-Image-2.1,视觉生成部分仅 7B 参数,团队称在其自建基准上超过多数闭源模型,独立基准尚待验证,可在 RTX 3090 等消费级 GPU 上运行。
9月20日
腾讯 Gander 模型实现边聊天边后台执行复杂任务The Decoder:AI News(RSS)60腾讯混元语音团队联合多所高校发布 Gander 模型,用"小脑"负责实时对话、可替换的"大脑"处理后台智能体任务(测试中用 GPT-5.6 家族模型),可同时处理语音、图像和文本并随时被打断。
阶跃星辰发布 Step 5 Preview:600B 参数 MoE 旗舰模型,10 月 15 日开放权重Hacker News 热门(buzzing.cc 中文翻译)68阶跃星辰(StepFun)发布旗舰模型 Step 5 Preview,主打智能体工作,采用稀疏 MoE 架构,总参数 600B、每 token 激活 27B,支持 1M token 上下文窗口和视觉输入。
Qwen 开源 Qwen-Image-2.1:7B 视觉生成组件统一图像生成与编辑Hacker News 热门(buzzing.cc 中文翻译)72Qwen 开源 Qwen-Image-2.1,在单一模型中统一文生图与图像编辑,视觉生成组件仅 7B 参数,并原生支持透明图像的生成与编辑。模型支持最多 10 张参考图、圆圈涂画和独立掩码指定局部编辑,通过混合粒度注意力与 KV cache 复用提升推理效率,并改进了文字排版、人像光照和人物产品一致性。
通义千问开源 Qwen-Image-2.1,统一图像生成与编辑并原生支持透明图像Hacker News:AI 热帖76Qwen 团队开源 Qwen-Image-2.1 图像模型,将文生图与图像编辑统一在单一模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/掩码指定局部编辑、人物与产品保真,并通过混合粒度注意力与 KV cache 复用提升推理效率,还改进了文字渲染与人像光照细节。
阿里 Qwen 团队发布并开源 Qwen-Image-2.1,一个 7B 的图像生成与编辑统一模型。官方称其推理速度大幅加快,可原生生成和编辑 RGBA 透明图层,支持最多 10 张参考图和精准局部编辑,覆盖全景图、信息图和虚拟试穿等场景。Chubby♨️@kimmonismus71QwenMeet Qwen-Image-2.1, the most balanced and cost-effective image generation model in the Qwen-Image series! Now open weig...
通义千问发布 Qwen-Image-2.1,vLLM-Omni 提供 day-0 支持。该模型可在一个模型内完成图像生成、编辑和透明图像输出,由 7.1B DiT 搭配 Qwen3-VL-8B 组成,设置和受支持的组合见 https://recipes.vllm.ai/Qwen/Qwen-Image-2.1。Qwen@Alibaba_Qwen62vLLMQwen-Image-2.1 from @Alibaba_Qwen has day-0 support in vLLM-Omni. 🎉 Generate, edit, and create transparent images with ...
阿里千问开源 Qwen-Image-2.1 图像模型,支持透明图像与最多 10 张参考图IT之家(RSS)67阿里千问开源图像模型 Qwen-Image-2.1,将文生图与图像编辑整合在同一模型中,视觉生成部分仅 7B 参数,原生支持透明图像的生成与编辑。更新亮点包括轻量结构与推理优化、支持最多 10 张参考图的局部编辑与人像商品保真,以及文字排版和人物光影表现提升,模型已上架 GitHub、HuggingFace 和 ModelScope。
通义千问发布 Qwen-Image-2.1,定位为 Qwen-Image 系列中均衡且高性价比的图像生成模型,现已开放权重。该模型为生成与编辑一体化的 7B 轻量架构,原生支持生成和编辑 RGBA 透明图层,编辑支持最多 10 张参考图和精确局部控制,并擅长全景图、信息图和虚拟试穿等场景。Qwen@Alibaba_Qwen59 Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像Qwen:Blog Retrieval(API)Selected72Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。
StepFun 发布旗舰模型 Step 5 Preview,主打 agentic 工作,覆盖软件工程与专业知识工作,在金融领域有特别优势。模型为 600B 总参数 / 27B 激活的 MoE 架构,支持 1M 上下文和视觉能力,官方称在相近智能水平下任务成本明显更低,现已可在 StepFun AI Studio 和 API 使用,开放权重将于 10 月 15 日发布。🚨 AI News | TestingCatalog@testingcatalog67StepFunIntroducing Step 5 Preview: Advancing the Pareto Frontier. Step 5 Preview is our new flagship model for agentic work, de...
阿里云通义发布新一代实时同声传译模型 Qwen3.8-LiveTranslate,采用 Interleave 架构,在 60 种语言上将平均延迟 LAAL 从 2.8s 降至 2.3s,并提升忠实度、流畅度与简洁性。新能力包括实时说话人分离并配合更稳定的音色克隆、源文与译文同屏双语显示,以及利用对话历史对人名和术语做长上下文消歧。已可通过 Qwen Cloud 和 Model Studio 试用。Alibaba Cloud@alibaba_cloud62 阿里通义Qwen团队发布Qwen3.8-LiveTranslate,实时翻译平均延迟降至2.3秒、支持60种语言MarkTechPost(RSS)63通义千问(Qwen)发布实时同声传译模型Qwen3.8-LiveTranslate,采用新的Interleave架构,平均滞后(LAAL)从2.8秒降至2.3秒,约降低18%。
阶跃星辰发布旗舰模型 Step 5 Preview,主打智能体工作,在软件工程和专业知识工作中达到前沿水平,金融领域尤其突出。模型为 600B 总参数 / 27B 激活的 MoE,支持 1M 上下文和视觉能力,官方称在相当智能水平下任务成本明显更低,已可在 platform.stepfun.ai 试用,开放权重将于 10 月 15 日放出。StepFun@StepFun_ai60 阶跃星辰发布旗舰模型 Step 5 Preview,AA 指数 44 分跻身全球开源模型前三,10 月 15 日开源IT之家(RSS)56阶跃星辰发布旗舰模型 Step 5 Preview,面向 AI 编程、软件工程、专业知识和金融场景,将于 10 月 15 日开源完整权重。
中电信发布星辰大模型 Xing4.0-29B-A4B,基于昇腾超节点训练并开源IT之家(RSS)61中电信人工智能科技于 9 月 17 日发布星辰大模型 Xing4.0-29B-A4B,总参数 29B、激活参数 4B,据称是国内首个基于昇腾 Atlas 900 A3 SuperPoD 液冷超节点与昇思 MindSpore 框架完成训练的百亿参数大模型。
阶跃星辰发布旗舰模型 Step 5 Preview,10 月 15 日开源权重公众号:阶跃星辰(Step)Selected66阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。
9月19日
Qwen3.8-Omni-Flash 发布,价格低于 Gemini Flash 且多模态基准相当The Decoder:AI News(RSS)68Qwen 发布首个面向 AI 智能体的多模态模型 Qwen3.8-Omni-Flash,可联合处理音频和视频并自主使用工具,上下文窗口达 100 万 token。
中国电信开源全栈国产轻量级智能体大模型 Xing4.0-29B-A4BIT之家(RSS)64中国电信于 9 月 17 日发布并开源新一代星辰大模型 Xing4.0-29B-A4B,总参数量 29B、激活参数 4B,原生支持 256K 上下文、可扩展至 512K,官方称是国内首个基于国产算力与国产框架完成训练的百亿参数大模型。
SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型,错误率降低约一半且价格不变IT之家(RSS)59当地时间 9 月 18 日,SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型,在价格不变的前提下错误率降低约一半。该模型基于 Grok Voice 底层音频基础模型构建,在 Artificial Analysis 全部 32 款流式模型中准确率居首;官方四个内部数据集评测均超越 1.0 版本。
Qwen 发布新一代实时同声传译模型 Qwen3.8-LiveTranslate,基于 Interleave 架构,在 60 种语言上将平均延迟(LAAL)从 2.8s 降至 2.3s,同时提升忠实度、流畅度和简洁性。Qwen@Alibaba_Qwen56 阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,支持原文译文同帧同出IT之家(RSS)63阿里千问发布同声传译大模型 Qwen3.8-LiveTranslate,基于 Hybrid MoE 的 Thinker-Talker 双模块设计,以 Interleave 架构重构实时同传,字均延迟(LAAL)从 2.8 秒降至 2.3 秒。
阿里巴巴达摩院开源医学影像模型 Damo Radar,可识别近150种腹部疾病Hacker News 热门(buzzing.cc 中文翻译)75阿里巴巴达摩院开源视觉语言模型 Damo Radar,可分析覆盖18个腹部器官的增强CT扫描,识别包括癌症在内的近150种腹部疾病。该模型用CT扫描配对临床报告训练,在近4万例真实检查中对146项临床发现取得平均 AUC 0.913;在26名放射科医生参与的对比研究中,平均准确率超过其中23人,医生借助模型将漏诊预防能力提高10%、耗时减少逾30%。
SpaceXAI 发布多语言语音转写模型 Grok Voice Transcribe 2.0,官方称其为最准确的语音转写模型,在 Artificial Analysis 榜单的 32 个流式模型中准确率排名第一。🚨 AI News | TestingCatalog@testingcatalog53SpaceXAIIntroducing Grok Voice Transcribe 2.0. It’s the world’s most accurate speech transcription model.
SpaceXAI 发布语音转文字模型 Grok Voice Transcribe 2.0,在 AA-WER Streaming 上以语音结束后 0.49 秒 2.7% WER 登顶最终转写和首个部分转写准确率。Artificial Analysis@ArtificialAnlys55 Jina AI 发布 jina-ocr-v1:3.4B MoE 文档解析模型,内置投机解码面向低预算 GPUMarkTechPost(RSS)58Jina AI 发布端到端视觉文档解析模型 jina-ocr-v1,总参数 3.4B,每 token 激活约 570M,可将 PDF、扫描件、表格和发票一次转成 Markdown。
OpenAI前研究员创办的TypeSafe发布非LLM新模型Jev,输出校准概率而非文本TechCrunch:AI(RSS)68OpenAI前研究员、RLHF共同发明人Almeida创办的TypeSafe AI发布基于transformer的新模型Jev,它不输出文本而是产生概率形式的校准决策。
PrismML 发布 Ternary Bonsai 2 27B:5.93 GB 三值权重模型保留 Qwen3.8 27B 98.2% 的性能MarkTechPost(RSS)65PrismML 发布 Ternary Bonsai 2 27B,将 Qwen3.8 27B 转为三值权重,模型仅 5.93 GB(FP16 为 53.80 GB),Apache 2.0 开源,官方称在 20 个基准上保留母模型 98.2% 的平均分,支持文本与图像输入和 262K token 上下文。
9月18日
xAI 发布 Grok Voice Transcribe 2.0 语音转文本模型xAI:News(网页)59xAI 发布 Grok Voice Transcribe 2.0,称其为目前最准确的转写模型之一,准确度是 1.0 的两倍且价格不变。
Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒Qwen:Blog Retrieval(API)Selected68Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker-Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。
阿里 Qwen 发布 Qwen3.8-Omni-Flash:1M 上下文的全模态智能体模型MarkTechPost(RSS)75阿里 Qwen 团队发布 Qwen3.8-Omni-Flash,称其为首款围绕智能体能力构建的全模态模型,接受文本、图像、音频和视频输入并返回文本,上下文窗口为 1M tokens。
阿里达摩院开源医疗影像 AI 模型 DAMO RADAR,可一次识别超 146 种病症并登上《科学》IT之家(RSS)74阿里达摩院与浙江大学医学院附属第一医院等机构研发的通用医疗影像 AI 模型 DAMO RADAR 登上《科学》并正式开源,面向腹部增强 CT 诊断,评估覆盖 146 种病症、18 个器官,近 4 万次真实世界检查中 AUC 达 0.913。
阿里发布全模态模型 Qwen3.8-Omni-Flash,支持音频和视频理解。该模型配备 1M-token 上下文窗口,在 WildClawBench-MM 与 UniClawBench 上性能接近 Gemini 3.8 Flash。🚨 AI News | TestingCatalog@testingcatalog61 PrismML 发布三值量化 Bonsai 2 27B,以不到 1/9 内存保留 Qwen3.8 27B 98.2% 性能IT之家(RSS)61PrismML 宣布推出三值量化版本的 Bonsai 2 27B,基础模型升级至 Qwen3.8 27B,以不到 1/9 的内存占用在综合基准测试中达到基础模型 98.2% 的分数,整体表现好于 Qwen3.6 27B。
Qwen3.8-Omni-Flash 发布:原生全模态模型主打音视频智能体能力Hacker News 热门(buzzing.cc 中文翻译)76Qwen 团队发布原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频、视频输入和 1M token 上下文窗口,在 29 项评测中平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%。
智谱上线 GLM-5.3-FlashX,推理速度最高 200 tokens/s公众号:智谱(GLM)61智谱正式推出 GLM-5.3-FlashX,在 GLM-5.3-Flash 基础上加大对 Infra 侧投入与推理优化,速度最高 200 tokens/s,算力基于 10 万张国产芯片。该模型此前曾以 Ox Alpha 之名面向开发者,官方称其长期保持同尺寸最强智能水平并具备高性价比,API 已上线,Model Key:GLM-5.3-FlashX。
阿里云发布 Qwen 首个围绕智能体能力构建的全模态模型 Qwen3.8-Omni-Flash,将音视频理解、推理和工具调用整合在一个模型中。Alibaba Cloud@alibaba_cloud70