国庆返工,AI 圈又更新到哪了?
从 Sol、Opus 和低成本 worker 的竞争,到 dots、决策模型与模块化 Harness,整理国庆前后值得工程师补课的 AI 进展,以及我对日常使用取舍的判断。
TABLE OF CONTENTS
国庆返工,把假期前后攒在周记里的 AI 新闻整理一下。模型又换了一轮,OpenAI 开完 DevDay,决策模型和 Harness 也有不少新东西,正好一起补课。
这轮更新里,Sol 6.1 和 Opus 5.5 都很适合拿来当主力,便宜 worker 则多了 Haiku 5.5 这个选择。对日常用 Agent 干活的人来说,最近确实是个好时候——除了 O 家的订阅额度。
信息截至 2026 年 10 月 8 日。

AI 生成示意图,按本文话题分组。
GPT-6.1 Sol:接近 Astra,价格只有五分之一
OpenAI 这次给 Sol 的定位终于很清楚了:主力模型。能力往 Astra 靠,标准 API 输入、输出单价只有 Astra 的五分之一、Opus 5.5 的一半。OpenAI 模型列表、Opus 定价
之前我还写过一篇文章,专门讨论怎么把好模型留给真正需要它的任务。Astra 很强,但额度不允许我什么都交给它。Sol 这次升级以后,日常开发就没那么纠结了,大部分工作交给 Sol,少数难题再上 Astra。
O 家目前的分工大概是这样:
| 模型 | 定位 |
|---|---|
| GPT-6 Astra | 前沿模型,处理最难的任务,贵 |
| GPT-6.1 Sol | 日常主力,接近 Astra,性价比高 |
| GPT-6 Luna | 廉价 worker,适合大量并行、边界明确的子任务 |
至于 Terra,这一轮已经没它的位置了,疑似被放弃。
Sol 的优势也能在 Artificial Analysis(AA)的任务成本对比里看到:Opus 5.5 的高推理档综合能力更强,Sol 做任务则明显便宜。预算有限又想多干活,Sol 很有吸引力。AA:Sol 与 Opus 对比

图:Artificial Analysis,9 月 29 日的 Sol 6.1 评测报告。重点看下半张:Sol 和 Astra 的能力已经很接近,成本却拉开了不少。这是当时的评测快照。
写代码,我更看好 Opus 5.5
Opus 5.5 这次是真的香。Anthropic 公布的 Terminal-Bench、FrontierCode、CursorBench 几项编程评测里,Opus 5.5 都超过了 Fable 5.1。Opus 5.5 发布说明
日常 coding 基本不用再惦记 Fable 了。 Opus 5.5 的编程能力已经到这个程度,价格还更低,我找不到继续默认用 Fable 的理由。
Sol 和 Opus 倒是都值得留。Sol 便宜,Opus 的能力上限更高,尤其写代码这件事上,我更愿意选 Opus。两家最近都把原本昂贵的能力往主力模型下放,这种竞争可以再多来一点。
Haiku 5.5,便宜 worker 又多了一个好选择
Luna 已经够便宜了,A 家紧接着又发了 Haiku 5.5,定位就是高频、低成本任务,也适合给更强的模型当 subagent。Haiku 5.5 发布说明
我现在把 Haiku 5.5 和 GPT-6 Luna 放在低成本 worker 的第一梯队,能力上 Haiku 排前面。AA 的最高推理档综合成绩也是 Haiku 领先。AA:Haiku 与 Luna 对比

图:Artificial Analysis,10 月 7 日 Haiku 5.5 报告。上半张看 worker 候选的能力,下半张看推理档位与输出 token 用量;后者不是美元成本。
DeepSeek、GLM、MiMo、Muse Spark 这些也还在候选里,但找便宜模型已经没必要只盯着国模了。O 家和 A 家连这一档都开始卷,对多 Agent 用户是好事。大量边界清楚的子任务,本来就没必要让最贵的模型从头跟到尾,现在可选的 worker 越来越多了。
dots:Astra 驱动的常驻助手
OpenAI 也下场做 Muse、OpenClaw、Hermes 这一类产品了。
dots 由 Astra 驱动,有自己的云电脑,也能在授权后使用本地电脑。它可以持续跟进事情,不用把每次对话都当成一次独立任务。dots 发布说明
Astra 驱动,而且聊天不计入 ChatGPT 额度,光这两点就值得试试。让 dot 发起或管理 Codex、ChatGPT Work 任务仍然正常计费,这部分别漏看。
我也很期待它能复用已有的工作上下文。每换一个助手就重新介绍自己、重新养一遍,实在太麻烦了。
O 家缩额度:还是 200 刀,预算砍半
模型发布看得挺开心,订阅这边就有点难绷了。同样每月 200 刀,O 家把额度往下砍,A 家的 Opus 5.5 却越来越值得用。
据 Kingy 对 Tibo 公告的整理,这轮 Pro 200 调整按 API 等值预算算,直接减半。Sol 降价确实能抵掉一部分消耗,但主要用 Astra 的人就没这个便宜可占了:模型没降价,可用预算少了一半。
| 每月 200 美元 | OpenAI Pro 200 | Claude Max 20x |
|---|---|---|
| 额度变化 | 新额度按报道中的 API 等值预算口径减半 | 仍提供 Claude Pro 的 20 倍用量 |
| 老用户安排 | 符合资格的老用户保留旧额度至 10 月 29 日,之后也转新额度 | 按 Max 20x 的订阅规则使用 |
| 我会怎么选 | Sol 继续用;重度 Astra 用户得重新算账 | Opus 5.5 很香,值得拿来当主力 |
额度来源:OpenAI Pro 官方说明、Claude Max 官方说明。减半比例来自上述报道;Claude 的 20 倍以自家的 Pro 为基准,两家的倍率不能直接相除。
这刀砍得真不少。Sol 更便宜是好事,但我买的是每月 200 刀的订阅,不是“以后只能多用便宜模型”的承诺。尤其之前冲着 Astra 买 Pro 的,现在得靠换模型来维持用量,很难说体验没缩水。
有旧额度的先猛猛开蹬。接下来我会更愿意把活分给 a/,不只是留个备份了,Opus 5.5 完全有资格当主力。
Jev 火了以后,大家都开始做决策模型
System One Models 这条线最近很热闹。Jev 把决策模型带火之后,OpenAI、Cloudflare 和开源社区都在跟进:
| 产品 / 项目 | 最近的进展 |
|---|---|
| OpenAI Decisions API | 由 GPT-6 Luna 提供能力 |
| Cloudflare Clef | 多模态、开放权重,提供 Workers AI 托管 |
| llama.cpp | 加入决策模型服务接口,支持 Clef 等模型 |
来源:Decisions 文档、Clef 发布说明、llama.cpp 发布记录。
我想拿它们做的东西还挺多:model router、UI 自动化 Agent、游戏 AI,甚至自动 reviewer?尤其是那些需要频繁做选择的地方,低延迟、低成本的决策模型很适合试一试。
Clef 开放权重,llama.cpp 又跟上了支持,本地部署也有得玩了。不想自己部署就用托管服务,已经用着 O 家 API 的也可以直接看看 Decisions。比起只有 Jev 一个选择的时候,现在折腾起来方便多了。
顺便给自己打个广告,我做了一个 midscene-jev-runner,把 Jev 接进 Midscene / Playwright 的 UI 自动化里。前面提到的 UI Agent,我自己就在折腾这个方向。
npm 包名是 @chlrc/midscene-jev-runner,用法在仓库 README 里。这是我做的社区项目,感兴趣的欢迎试用、提 issue,顺手点个 star 也行。
社区的逆向和复现也值得继续跟,Jev 这类模型到底怎么实现,我还想再研究一下。
Harness 越来越模块化了
DeepSeek Harness 的官方桌面客户端已经发布,我本地也装好了,简单体验了一下,设计得确实挺好。DeepSeek Harness 官网、官方仓库
国内这几家的 Harness,dsh 是我觉得唯一能对标 Codex 的产品,比豆包、ZCode 强不少。 操作直观,模型细节也暴露得很到位。界面好用,又没有为了“简单”把该给用户的控制藏起来,这点很舒服。
而且它是完全模块化的。Everything is a Plugin,不是做完一个固定的聊天壳子,再给你留几个扩展点。对喜欢自己改工具的人来说,这种设计太有吸引力了。
单看插件化和可组合的设计,dsh 目前真有点暴打 opencode 和 pi 的意思。桌面端又把这套东西做得直观、好用,这次确实值得装一个试试。
| 模型与推理等级 | 插件列表 |
|---|---|
![]() | ![]() |
| 模型和推理等级直接在输入框旁边选。 | Agent 循环、子智能体、终端都能在插件里找到。 |
本机桌面客户端实拍;点击图片可查看原图细节。
Claude Code 也开放了 mods,第一方 Harness 同样开始让用户往里改。Claude Code mods
我觉得 Harness 已经是一个正式的产品分层了。选什么模型是一回事,用什么 Harness、能不能改成自己想要的样子,又是另一回事。dsh 和 Claude Code 都在往模块化走,后面这块应该会有不少好玩的东西。
运行环境也有更新。Cloudflare Sandbox、Docker Cloud Sandboxes、新版 Codex Cloud 都可以看看,云端 sandbox 已经有了好几个选择。Cloudflare Sandbox、Docker Cloud Sandboxes、Codex Cloud
做 Agent 的工程师最近应该不缺东西折腾了:模型、Harness、runtime,每一层都有新选择。
Gemini 4 Argon:Google 重回牌桌
Google 终于也跟上来了。Gemini 4 Argon 在 AA 的综合 Intelligence Index 上已经追平 Astra,只是目前还没有全面公开可用。AA:Gemini 4 Argon

图:Artificial Analysis,9 月 30 日 Gemini 4 Argon 报告。Argon 和 Astra 的综合成绩在同一水平;下半张的 Argon 成本按首发五折促销价计算。
成绩是挺好看的,等开放了再试。现在 Sol、Opus、Haiku、Luna 已经够用一阵,Google 再加进来,接下来估计还会继续卷。

