AI 一周:Agent 学会主动找你,三巨头却集体喊慢一点

Feng 8 阅读 AI资讯

这一期「周一上线」,Agent 又往更长的任务链和更具体的工作场景里迈了一步。SWE-2 在收敛 Agent 的无效试探,Muse 已经能自己常驻后台推进任务,DeepSeek V4.1-Flash 则继续从长上下文的成本账上开刀。

Agent 的边界也在持续外扩:HyperFrames 让视频变成可以被 Agent”写”出来的东西,Marketing Skills 把 Skill 的用法推进了营销流程。另一头,Astra 的火爆让 OpenAI 暂时关掉了 200 美元档 Pro 的新订阅入口,DeepSeek 开始集中补工程岗,Cognition 则刚拿到超过 20 亿美元的新融资。

开发者这边照例不缺乐子:让果蝇写汇编、把 250 万行代码摊成一张地图、再用不到 280 个字符点一把火。

下面开始这一周的回顾。

有点新鲜

这个小栏目收录的是本周 AI 与开发者圈里算不上头条、但值得瞄一眼的新鲜事。

Gemini:别问走了多少步,就说到了没有

Cursor 把 CursorBench 升到 4.0,结果 Gemini 3.8 Flash 直接跑到了图的最左边。别人完成同类任务大多几十到一百多步,Gemini 3.8 Flash High 平均要走到 324 步,最后拿下 39.6% 的成绩。

配图

Google:这周的面子得靠果蝇撑

Google 刚用 AI 重构出雄性果蝇的完整脑图谱,网友们顺手把它捧成了新晋顶流——一会儿让它解魔方,一会儿让它写 x86-64 汇编,还有人让它管 Kubernetes。

配图

它甚至被推上了”Google AI 最受欢迎发布”的榜单。Google 负责重建 16.6 万以上的神经元,网友负责让这只果蝇直接上岗。

配图

250 万行代码,摊平了给你看

代码库太大怎么处理?先给它修一张地图。@Rik Arends 把一个 250 万行的代码库做成了可交互的可视化浏览器:模块、目录与代码之间的依赖关系被铺成一张巨型地图,放大看像一座代码城市,缩小看又有点像芯片版图。

配图

机器人守门,来一局空气曲棍球

有人搭了一套 AR 空气曲棍球:由真实的 Vector 机器人负责守门,球和球场则全部落在增强现实里。实体机器人和虚拟世界就这么在一张桌面上打了起来。

配图

280 个字符,够不够点一把火

@Xor 用不到 280 个字符写出了一团会动的火焰 Shader。

配图

f z, d
@(40)
{
f3 p = z * nor(2*C.rgb - R.xyy)
p.zy+=3
d=2; @(7) d/=.8,
p +=.6*p.y*cos(p.yzx * d - f3(T,,)*6) / d
z += d = .02 + abs(len(p.xz) + p.y*.4 -1) / 9
O += (sin(f4(5,0,2,)-p.y) + 2) / d
}
O = tanh(O*O / 15e5)

周五发版

「周五发版」是个程序员梗:版本一上线,就只能祈祷一切照常运行。这个栏目借它祝所有模型和产品的更新都能大吉大利。

SWE-2:在 Kimi K3 上继续炼出的 Coding 模型

Cognition 发布了新一代 Coding 模型 SWE-2。它以 Kimi K3 为底座继续后训练,并第一次把强化学习推到了万亿参数级别。SWE-2 在 FrontierCode 1.1 Main 上拿到 50.0%,距离 Claude Fable 5.1 不到一个百分点,成本却低了 64%。

配图

这轮优化并不只是追分数,也在压掉 Agent 的无效探索。官方测试中,SWE-2 medium 相比 SWE-1.7 的平均执行步骤从 127 步降到 53 步,成本下降 81%。目前 SWE-2 已上线 Devin Desktop 和 CLI,接下来会陆续进入 Devin Web 与 Fusion;未来一个月内,Pro、Max 和 Teams 的订阅用户可以免费用上它。

ChatGPT 图像 2.5:编辑更稳,生成最多快一半

OpenAI 推出 ChatGPT 图像 2.5,重点补强了参考图保真度、局部编辑以及多轮修改的一致性。相比图像 2.0,新模型的生成延迟最多降低 50%,也更擅长只改指定区域,而不把周围的主体、构图和整体风格一起带跑。

配图

ChatGPT 里同时上线了 Sketch,可以直接画草图当作生成参考。API 侧则给出 GPT-Image-2.5 Flare 与 Sunburst 两款:Flare 主打速度和通用生成,Sunburst 面向更精细的高端创作与多轮编辑。眼下所有层级的 ChatGPT、ChatGPT Work 以及 Codex 用户都已能用上图像 2.5。

Muse:Meta 做了一个会主动找上门的 Agent

Muse 不满足于等你一问一答。它拥有自己的电脑、文件系统、终端和浏览器,能并行处理多个任务,在后台持续运转,还能根据日程和事件主动把任务往前推;查资料、填表单、下单购物、预订安排,以及生成网页、PDF、Dashboard 这类 Artifacts 都在它的活儿清单里。

配图

它还会主动给用户发消息:任务有新进展、发现了需要留意的情况,或者需要你拍板时,它才会回来找你。碰到发邮件、付款这类难以撤回的操作,它会先停下来等你确认。

MiniCPM5-2B:小模型继续往端侧 Agent 走

OpenBMB 放出 MiniCPM5-2B,一个约 25 亿参数的稠密模型,原生支持 131K 上下文,主攻本地助手、Coding Agent、工具调用和端侧部署。官方表示,在它的对比范围内 MiniCPM5-2B 达到了 2B 级开放模型的 SOTA,在代码、数学、长上下文、工具调用与 Agent 任务上尤其突出。

配图

这次不只开放权重,还一并放出了训练数据,包含 50 万条 Agent 训练样本和 8 万条以上的强化学习数据。部署侧提供 GGUF、MLX 4bit、GPTQ 等版本,可以接 llama.cpp、Ollama、LM Studio、vLLM 与 SGLang。

DeepSeek V4.1-Flash:把 1M 长上下文的 KV Cache 再压到四分之一

DeepSeek 发布并开放了 DeepSeek V4.1-Flash。新模型采用 552B backbone 的多模态 MoE 架构,支持图片、文本和 1M Token 上下文,预填充阶段每 Token 激活约 8B 参数,生成阶段约 16B。

配图

借助新的 Causal Encoder-Decoder、CSA2 稀疏注意力与 FP4 KV Cache 等设计,V4.1-Flash 把全局 KV Cache 压到约 890 Bytes / Token,只有 V4-Flash 的四分之一左右;针对输入特别长的 Agent 负载,目标很明确——把长上下文的推理成本打下来。模型还支持 1 到 100 连续可调的推理强度。

Agent 能力同样往前挪了一大截。官方 Agent 评测里,DeepSeek V4.1-Flash 在 Terminal-Bench 2.1 上达到 90.6%(使用 DSH Minimal),DeepSWE v1.1 达到 74.2%(使用 mini-SWE)。相关 scaffold 对比统一采用 1M Token 的上下文限制。

开源雷达

周榜速递

周榜主要按新增 Star 数排序,下面挑选的单个项目则更偏向新晋项目和实用的老项目,标星数并不是选讲的唯一标准。

配图

TileRT:把大模型推理切成 Tile,专攻超低延迟

TileRT 是一个面向超低延迟大模型推理的运行时。与更强调批量吞吐的传统推理框架不同,它优先优化单请求的响应速度,把模型计算切成细粒度的 Tile 任务,再让计算、通信和 I/O 动态交错,尽量少让 GPU 空转等待。

配图

目前它支持 DeepSeek-V3.2 与 GLM-5 / 5.1,并加入了 Prefill / Decode 分离:可以让 vLLM 负责 Prefill,由 TileRT 接管 Decode。官方还曾在 8 张 B200 上把 1T 参数的 MiMo-V2.5-Pro-UltraSpeed 推到 1000+ Token/s。

Spec Kit:让 Coding Agent 先把需求写清楚再动手

Spec Kit 是一套规格驱动的开发工具,核心主张是别让 Coding Agent 拿到需求就直接写代码,而是先把”要做什么”固化成明确的 Spec,再产出技术方案、拆解任务,最后才进入实现。官方流程大致是 Specify → Plan → Tasks → Implement → Converge。

配图

它并不绑定某个具体的 Coding Agent,Copilot、Claude Code 等工具都能接。

God’s Eye View:把公开世界数据塞进一颗 3D 地球

God’s Eye View 是浏览器里的一个实时 3D 地球,把飞机、船舶、卫星、地震、公共摄像头等公开数据收进同一个可探索界面。你可以从全球视角一路放大到某架飞机、某艘船或某个摄像头,也能在座舱、夜视、热成像等观察模式之间切换。

配图

项目还接了实时 AI Agent,可以直接用自然语言指挥地图。默认不需要 API Key 就能启动;如果补上 Cesium、Google Maps 或 OpenAI 等服务,还能继续解锁更精细的 3D 地图与语音交互。

HyperFrames:让 Agent 直接用 HTML 做视频

HyperFrames 是 HeyGen 开源的一套视频生成框架,能把 HTML、CSS、媒体素材与可控时间轴的动画确定性地渲染成 MP4。相比让模型去操作传统视频编辑器,它更像是把视频变成了一个 Agent 可以”写代码生成”的对象。

配图

项目同时提供一整套 Agent Skills,覆盖从产品宣传片、PR 讲解、字幕、Talking Head 包装,到动态图形、音乐视频和幻灯片等不同工作流。Codex、Claude Code、Cursor 等支持 Skill 的 Agent 都可以接入。

Superpowers:给 Coding Agent 装一套工程方法论

Superpowers 的目标说起来很简单:别让 Agent 一上来就写代码,先按一套完整的工程流程把事情做扎实。Agent 开工前先澄清需求、形成设计,再拆成足够明确的实施计划,之后通过 TDD 和子 Agent 分工持续执行、检查并推进任务。

配图

它由一组可组合的 Skills 和初始规则构成,目前已经支持 Claude Code、Codex、Cursor、Gemini CLI、Devin CLI、GitHub Copilot CLI 等多种 Agent 环境。

Marketing Skills:把 Agent Skill 从写代码扩到做营销

Marketing Skills 是一套面向营销工作的 Agent Skills,把 Coding Agent 擅长的文件处理、脚本与自动化能力延伸到 CRO、文案、SEO、广告、数据分析、增长和销售支持等任务上。

配图

它让不同 Skill 共享上下文并互相引用,比如 product-marketing 会作为基础信息层,其他 SEO、CRO、文案、定价、增长等 Skill 再基于同一套产品和用户信息接着往下做。

这周有事

这个栏目收录本周值得记一笔的行业动态、事故、融资、人员流动与基础设施变化。

Cognition 再融 20 亿美元,估值站上 480 亿

Cognition 宣布完成超过 20 亿美元的 E 轮融资,估值达到 480 亿美元。本轮由 a16z 和 Accel 领投,Founders Fund、General Catalyst、Avenir 等继续跟投。

配图

今年 5 月上一轮融资时,Cognition 的年化收入约为 4.92 亿美元;短短几个月后已经接近 9 亿美元。与此同时,公司估值也从 5 月的 260 亿美元接近翻番。

Astra 太火,OpenAI 暂时关掉 Pro 新订阅

Astra 上线后需求远超预期,OpenAI 暂停了新的 200 美元/月 Pro(Pro 20X)订阅和升级通道。Tibo 表示,Pro 用户对系统资源的压力最大,因此先暂停新订阅,以保障现有用户继续稳定访问 Astra。

配图

已有的 Pro 用户不受影响,其他套餐和 API 仍然开放;OpenAI 同时表示正在尽快扩容,目前没有公布恢复 Pro 新订阅的具体时间。

Dario 呼吁踩刹车,Altman 和马斯克都点头了

Anthropic CEO Dario Amodei 发表文章《We Must Pace the Frontier》,认为前沿 AI 的能力增长已经开始跑在安全措施前面,行业应当适当放慢能力提升的节奏,给对齐、安全和外部评估留出更多时间。

配图

Anthropic 同时承诺先落实第一步:让独立的第三方评估机构获得长期、接近员工权限的系统访问,用于检查安全措施、报告事故,并评估模型训练过程中的对齐状况。Sam Altman 随后表示 OpenAI 也会采用类似做法,马斯克则直接回应:”Dario is right.”

AI 虚拟偶像 Yuri,把 AIGC 搬上了百米巨幕

9 月 11 日,Yuri 尤栗在 2026 外滩大会完成了线下 AI 音乐会。现场使用了接近百米的巨幕,实际分辨率约为 12K;据团队介绍,除真人演员和艺术家外,屏幕上的大部分内容都由 AI 生成,Yuri 自己的歌曲、部分合唱与串场内容也大量采用 AI 生成。

配图

团队此前更熟悉移动端和短视频内容,但把 AIGC 放到这种超大屏、长时间的现场演出里之后,原有的制作方法基本都得重来。这次更像是在验证一件事:AI 影像除了在线上刷屏,也开始真正走进线下舞台。

DeepSeek 扩招 150 人,却没有一个 AI 研究岗

DeepSeek 新开放约 150 个招聘名额,重点面向有 2 到 10 年经验的工程师。有意思的是,这批岗位里没有 AI 研究岗,主要集中在两类:服务端开发工程师和 Agent 弹性计算研发工程师。

配图

具体方向覆盖大模型研究平台、Agent 框架、研发效率基建、DeepSeek API、线上服务、数据工程,以及面向 Agent 的弹性计算平台 DSec。崔添翼给出的解释也很直白:随着数据、机器、训练任务、评测任务、Agent 环境、用户和请求量一起膨胀,系统复杂度正在快速上升,需要更多工程力量把这些能力真正撑住。

Feng
这位作者很神秘,还没有填写简介。