OpenAI 更新 ChatGPT 桌面应用,新增对 ChatGPT Voice 的支持,用户可直接通过语音对话控制 AI 智能体并让其在电脑上执行任务。该功能基于全新语音模型系列 ChatGPT-Live,支持 ChatGPT Work 和 Codex,在 macOS 上还可借助 Appshots 访问屏幕内容。
AI 动态
模型、产品、Agent、研究,一屏读完高信号变化。
精选
高信号更新流
当前热点
- 1
- 2
- 3
- 4
- 5
8月9日
OpenAI 桌面端 ChatGPT 上线语音交互功能,可语音操控电脑执行多步骤任务IT之家(RSS)精选72 Grok Imagine 图像编辑迎来重大升级
Elon Musk@elonmusk, xAI精选66Grok Imagine 图像编辑功能重大升级 【引用 @XFreeze】:你可以直接悬停在 Grok Imagine 中的任意特定区域,并即时进行编辑
X Freeze你只需将鼠标悬停在 Grok Imagine 中的任意特定片段上,就能立即对其进行编辑。
8月8日
苹果 Mac 简体中文支持文档更新,"Apple 智能"阿里千问扩展现身IT之家(RSS)精选76苹果官网 Mac 简体中文使用手册新增《在 Mac 上配合 Apple 智能使用千问》支持文档,明确 Apple 智能可配合阿里巴巴千问模型工作。千问扩展适用于 macOS 26.6 或更高版本,需中国大陆 Apple 账户及机型,支持写作工具与 Siri,用户需登录千问账户使用。
Claude Code 会话间可互发消息
ClaudeDevs@ClaudeDevs精选73Claude Code 新功能:你的会话现在可以互相发送消息了。 无需在另一个会话中重新解释自己,你现在可以让 Claude 代为传达。它会发送一份摘要(而非你的历史记录或文件),另一个会话会在任务进行中接收该摘要。

Kitesurf:一款在 V8 隔离环境中运行的"代理优先"浏览器Hacker News 热门(buzzing.cc 中文翻译)精选77Cloudflare 推出 Kitesurf,一款专为 AI 智能体设计的浏览器,完全运行在 Workers 上,基于 V8 隔离环境,现已在 Browser Run 中免费开放测试。
Claude Code 八月起默认自动模式
ClaudeDevs@ClaudeDevs精选57自 8 月 14 日起,自动模式将成为 Claude Code 中 Pro、Max 和 Team 用户的默认权限模式。 自动模式使用独立的分类器审查 shell 命令和操作。在测试中,它捕获了 89% 的危险命令。手动审批仅捕获了 14%。
LangChain 推出 Managed Deep Agents 公开测试版LangChain:Blog(RSS)精选62LangChain 的 Managed Deep Agents 进入公开测试版,可将 Deep Agents 部署到托管的 LangSmith 运行时。该服务提供持久化执行、记忆、沙箱、通道、评估(evals)及生产级基础设施。
8月7日
HPC-Ops × SGLang:腾讯混元开源高性能 Attention、Router GEMM 与 MoE 算子LMSYS:Blog(Chatbot Arena 团队)精选76腾讯混元开源算子库 HPC-Ops 已集成至 SGLang 主分支,其 Dynamic Attention 与 Fused MoE 在 Hy3 模型上最高降低 TPOT 48.8%。
Suno移动端上线Voices功能
Suno@suno精选65Voices 功能已在 Suno 移动应用 iOS 和 Android 版正式上线!📱✨ 现在你可以直接在手机上录制人声,并将其用于你的歌曲中。只需在创作界面点击"+ Voice"按钮,录制至少一分钟,然后让音乐流淌起来。(Pro 和 Premier 套餐可无限使用,免费套餐可体验有限版本!) 打开应用,录制你的声音,并在评论区告诉我们你的使用体验!

Runway 上线 Seedance 2.5,支持 50 个角色参考
Runway@runwayml精选75Seedance 2.5 现已登陆 Runway。每次生成最多可引用 50 个角色参考,构建充满角色的完整世界;可创作最长 30 秒、带完整音效与对白的片段,再按你的故事需求随意剪辑与延展。 点击下方链接立即开始。

Krea 推出 Seedance 2.5 视频模型
Krea@krea_ai精选72推出 Seedance 2.5。 30 秒连续视频、完整多镜头序列,以及最多 50 个参考。 立即试用 👇

Seedance 2.5 API上线,视频生成开启「电影级长叙事」公众号:火山引擎精选81火山引擎正式上线 Seedance 2.5 API,将单次视频生成时长从15秒提升至30秒,并支持最高50个全模态素材参考。模型在指令遵循、长叙事、真人感及声画质感上大幅提升,能稳定保持多角色外形与场景关系,兼容十余种语言。
Anthropic 更新 Claude Fable 5 生物安全防护,误报率大幅降低Anthropic:Newsroom(网页)精选66Anthropic 更新了 Claude Fable 5 的生物安全防护机制,将生物相关查询的"回退"次数减少约 85%,用户在日常健康与教育问题上将更少遇到系统切换至较弱模型的情况。此次更新扩大了模型可协助的生物任务范围,但涉及双重用途的病毒学、毒理学和分子设计请求仍会回退至 Opus 5。Anthropic 表示正通过可信访问途径,致力于缩小专业生物研究与药物开发领域的差距。
千问功能上新:推出思考研究、定时任务、办公助理、语音通话等多项新功能,并支持 Qwen3.8-MAX公众号:千问APP(阿里)精选67千问今日上线多项新功能,并支持最新旗舰模型 Qwen3.8-MAX。其中"思考研究"在原"深度思考"基础上升级,强化复杂推理与工具调用;"定时任务"可预设执行时间自动完成行业简报梳理等周期工作;"办公助理"能连接备忘录、日历等应用并操作电脑浏览器,直接输出可用的 Office 文档。语音通话支持 7x24 小时多场景,智能体广场首批覆盖物流、房产等十多个领域。
OpenAI 优化 ChatGPT 中的 GPT-5.6 Sol,并扩大免费用户对 GPT-5.6 Luna 的访问权限Hacker News 热门(buzzing.cc 中文翻译)精选74OpenAI 更新 ChatGPT:Plus 和 Pro 用户的 GPT-5.6 Sol 在事实准确性和回答聚焦度上有所提升,新增滑块可控制模型思考投入。免费用户默认模型升级为 GPT-5.6 Luna,并开放无限文本聊天,新增 Think 按钮以处理更复杂问题。
Agent Plugins 1.0.0 发布:谷歌、亚马逊、微软等支持的统一智能体插件规范Google Developers Blog(RSS)精选75Agent Plugins 1.0.0 是一项由谷歌、亚马逊、微软等支持的中立目录规范,将 Agent Skills 和 MCP 服务器打包为单一可移植单元。通过标准化 plugin.json 清单和固定目录布局,开发者无需为不同 AI 编码智能体和 IDE 维护单独封装。谷歌已作为核心维护者加入,并在 Agents CLI 和 Data Agent Kit 中提供支持。
8月6日
谷歌地图 Ask Maps 智能体升级:可对话订餐、找酒店并接入 Gemini Personal IntelligenceIT之家(RSS)精选71谷歌地图宣布 Ask Maps 迎来新一轮升级,新增智能体功能,可替用户执行订餐操作,并综合考虑饮食要求、当前位置和收藏地点等信息;用户还可通过对话指定装修风格、环境氛围等条件查找酒店和当地活动。
千问全网首发公测,全新 Wan3.0 来了!公众号:千问APP(阿里)精选64阿里千问全网首发公测视频生成模型 Wan3.0,在生成时长、镜头语言、角色真实感及一致性保持等维度全面升级。该模型支持稳定直出 30 秒一镜到底视频,具备导演级镜头与蒙太奇叙事,并强调角色、道具、场景高一致性保持。Wan3.0 主打超高性价比,现已在千问创作(c.qianwen.com)开放体验,千问 app 也将陆续开启。
Qwen-Image-3.0 发布:高分辨率低至 0.03 美元
Alibaba Cloud@alibaba_cloud精选81Qwen-Image-3.0 已可投入生产。支持 4.5K token 提示词。100%+ 文本准确率(无破损 logo)。原生支持 12 种语言。定价灵活可扩展:高分辨率低至 $0.03。完整详情见图片。👉 探索:• Model Studio:https://click.alibabacloud.com/m/20000001606/ • Qwen Cloud:https://click.qwencloud.com/m/20000001648/ #Qwen #QwenImage3 #AlibabaCloud #GenerativeAI #AICreativity

Prime Agent:一个具有自我改进能力的RLM代理Hacker News 热门(buzzing.cc 中文翻译)精选70Prime Agent 是一个自我改进的编码代理,围绕递归语言模型(RLM)和持续框架(Continual Harness)两大抽象构建,将上下文视为变量、子代理委派视为 REPL 内的函数调用,并允许代理对其提示词、技能、记忆和子代理进行 CRUD 操作。它完全开源,可通过 curl 命令安装,支持与前沿模型即时使用,并具备后台守护进程、会话恢复、分支分叉和异步内核压缩等特性。
8月5日
Grok 4.5 免费体验,推荐 Build 工具链
Elon Musk@elonmusk, xAI精选66使用 Grok 的最佳方式是通过我们的 Build 工具链。 下载地址:http://X.ai/cli
Grok免费试用 Grok 4.5,这是一款全新的 Opus 级模型,速度快且成本低。非常适合真实世界的编码和工程任务。
LLM 0.32 发布:新增推理轨迹、OpenAI Responses、服务端工具与更智能的日志Simon Willison 博客精选79Simon Willison 发布 LLM 0.32,这是该项目自启动以来最重要的新版本。新版本支持显示推理轨迹、服务端工具、OpenAI Responses API,并默认使用 GPT-5.6 Luna 模型。
Replit 环境智能:免提示词自动生成设计
Replit ⠕@Replit精选69你无需提示词,也无需设计语言。 环境智能(Ambient Intelligence)会在每个画面旁显示建议卡片,每张卡片都指向你的设计的一个不同方向。点击你喜欢的那张,即可看到它生成一个新的画面。 你再也不必纠结下一步该做什么。 立即在 http://replit.com/design 体验。

Soup v0.72.4:在4 GB显存笔记本GPU上微调8B模型Hacker News 热门(buzzing.cc 中文翻译)精选73Soup 推出 v0.72.4,支持在配备 4 GB 显存的笔记本 GPU 上通过 QLoRA 微调 8B 模型,无需 SSH 或云服务。
Google Cloud API Gateway 推出统一模型路由功能,支持 Gemini、Claude 与 OpenAI OSS-GPTGoogle Developers Blog(RSS)精选61Google Cloud API Gateway 新增模型路由功能(Public Preview),开发者可在 OpenAPI 3.x 规范中配置虚拟模型名到后端目标的映射,无需硬编码端点或管理开源代理。网关作为无服务器入口层,接受标准 OpenAI 兼容请求,自动将负载转码为目标模型的原生格式并动态路由流量。
Google Cloud 推出 Database Operations Agents,实现自主数据库管理Google Cloud:Databases(RSS)精选60Google Cloud 在 Agentic Data Cloud 发布中推出两款 AI 数据库智能体:Database Onboarding Agent 负责 Day 0 的配置与部署,Database Observability Agent 负责 Day 1/2 的监控、故障排查与维护。
8月4日
SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型LMSYS:Blog(Chatbot Arena 团队)精选72SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。
OpenRouter 推出 ori CLI:为 Claude Code 等 Harness 提供开箱即用的优化配置OpenRouter:Announcements(RSS)精选73OpenRouter 发布 ori CLI,用户安装并登录后即可获得针对 Claude Code、Codex、OpenCode、Hermes 等 harness 的优化配置,省去手动设置大量环境变量的麻烦。
NVIDIA 开源 cuFile API,推动 GPU 直连存储NVIDIA Blog(RSS)精选62NVIDIA 在 FMS 大会上宣布开源 cuFile API 及底层存储软件栈,让 GPU 可直接读写存储,访问延迟降至微秒级。其 Vera CPU 在两级压缩与加密流水线中吞吐量比 x86 CPU 最高提升 3.21 倍,并联合 40 多家厂商推出 Storage-Next 计划。
Reflex 开源 XY:基于 Rust 的超快 Python 绘图库,可保持 1 亿点图表交互流畅MarkTechPost(RSS)精选79Reflex AI 发布 Apache-2.0 许可的 Python 交互式 2D 绘图库 XY,通过 Rust 原生核心、二进制缓冲传输和 WebGL2 渲染,在 1 万至 1 亿点范围内保持约 0.08 秒的渲染时间。
Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版Hacker News 热门(buzzing.cc 中文翻译)精选81Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。
面壁智能开源 ForgeStencil:一周自动优化 100+ 工业与科学软件,全程零人工介入公众号:面壁智能(MiniCPM)精选78面壁智能联合 OpenBMB 开源全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统 ForgeStencil,由 Kernel Agent 与 App Agent 闭环协作,实现从算子优化到应用集成的全自动流程。
GPT-Live实时音频新架构发布
Greg Brockman@gdb精选66GPT-Live 是一种用于实时音频的新架构和栈: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 规模下显得自然,我们从客户端到模型重建了语音栈。 这一新架构让音频持续流动,因此更深入的推理和工具使用不会打断对话。
OpenAIGPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 的规模下显得自然,我们从客户端到模型彻底重建了语音技术栈。 这一新架构让音频持续流动,因此更深入的推理和工具调用不会打断对话。
微软开源 Orchard 智能体训练框架
Microsoft Research@MSFTResearch精选65Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它降低了复杂性,同时通过让研究人员复用同一套基础设施,支持较小模型也能实现强劲性能。https://msft.it/6019a8fqP

8月3日
OpenRouter 推出 Ori Eval 简化评估流程
OpenRouter@OpenRouter精选68推出 Ori Eval:编写首个评估的最简单方式。 没有绝对最好的模型,只有最适合每项任务的模型。Ori Eval 利用 OpenRouter 的 API 处理代码库中的每项任务,然后评估结果。 curl -fsSL https://openrouter.ai/skills/spawn-ori-eval
