Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。
AI Pulse
Models, products, agents, research — read the high-signal changes in a single screen.
Timeline
AI for ScienceAll Signals
An AI feed unfolding by time
HOT SIGNALS
Multi-source heat · decays over timeCurrent Hotspots
- 1
- 2
- 3
- 4
- 5
9月20日
Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像Qwen:Blog Retrieval(API)Selected72 阶跃星辰发布旗舰模型 Step 5 Preview,10 月 15 日开源权重公众号:阶跃星辰(Step)Selected66阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。
9月18日
xAI 发布 Grok Voice Transcribe 2.0 语音转文本模型xAI:News(网页)59xAI 发布 Grok Voice Transcribe 2.0,称其为目前最准确的转写模型之一,准确度是 1.0 的两倍且价格不变。
Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒Qwen:Blog Retrieval(API)Selected68Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker-Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。
智谱上线 GLM-5.3-FlashX,推理速度最高 200 tokens/s公众号:智谱(GLM)61智谱正式推出 GLM-5.3-FlashX,在 GLM-5.3-Flash 基础上加大对 Infra 侧投入与推理优化,速度最高 200 tokens/s,算力基于 10 万张国产芯片。该模型此前曾以 Ox Alpha 之名面向开发者,官方称其长期保持同尺寸最强智能水平并具备高性价比,API 已上线,Model Key:GLM-5.3-FlashX。