MENU ~/

 _____ 
/     \
| () () |
\  ^  / 
 |||||  
 |||||  

    

ChlorineC

Coding With Passion

SEARCH

$ grep
SYS.VER 1.0.4
© 2026
chlorinec@blog:~/posts/ai-catch-up-after-national-day-2026

$ cat ~/posts/ai-catch-up-after-national-day-2026.md

国庆返工,AI 圈又更新到哪了?

从 Sol、Opus 和低成本 worker 的竞争,到 dots、决策模型与模块化 Harness,整理国庆前后值得工程师补课的 AI 进展,以及我对日常使用取舍的判断。

TABLE OF CONTENTS

国庆返工,把假期前后攒在周记里的 AI 新闻整理一下。模型又换了一轮,OpenAI 开完 DevDay,决策模型和 Harness 也有不少新东西,正好一起补课。

这轮更新里,Sol 6.1 和 Opus 5.5 都很适合拿来当主力,便宜 worker 则多了 Haiku 5.5 这个选择。对日常用 Agent 干活的人来说,最近确实是个好时候——除了 O 家的订阅额度。

信息截至 2026 年 10 月 8 日。

国庆 AI 热点概览:模型、决策模型与 Harness 三组更新

AI 生成示意图,按本文话题分组。

GPT-6.1 Sol:接近 Astra,价格只有五分之一

OpenAI 这次给 Sol 的定位终于很清楚了:主力模型。能力往 Astra 靠,标准 API 输入、输出单价只有 Astra 的五分之一、Opus 5.5 的一半。OpenAI 模型列表、Opus 定价

之前我还写过一篇文章,专门讨论怎么把好模型留给真正需要它的任务。Astra 很强,但额度不允许我什么都交给它。Sol 这次升级以后,日常开发就没那么纠结了,大部分工作交给 Sol,少数难题再上 Astra。

O 家目前的分工大概是这样:

模型定位
GPT-6 Astra前沿模型,处理最难的任务,贵
GPT-6.1 Sol日常主力,接近 Astra,性价比高
GPT-6 Luna廉价 worker,适合大量并行、边界明确的子任务

至于 Terra,这一轮已经没它的位置了,疑似被放弃。

Sol 的优势也能在 Artificial Analysis(AA)的任务成本对比里看到:Opus 5.5 的高推理档综合能力更强,Sol 做任务则明显便宜。预算有限又想多干活,Sol 很有吸引力。AA:Sol 与 Opus 对比

AA 的 GPT-6.1 Sol 评测:上半部分比较综合能力,下半部分比较能力与评测成本

图:Artificial Analysis,9 月 29 日的 Sol 6.1 评测报告。重点看下半张:Sol 和 Astra 的能力已经很接近,成本却拉开了不少。这是当时的评测快照。

写代码,我更看好 Opus 5.5

Opus 5.5 这次是真的香。Anthropic 公布的 Terminal-Bench、FrontierCode、CursorBench 几项编程评测里,Opus 5.5 都超过了 Fable 5.1。Opus 5.5 发布说明

日常 coding 基本不用再惦记 Fable 了。 Opus 5.5 的编程能力已经到这个程度,价格还更低,我找不到继续默认用 Fable 的理由。

Sol 和 Opus 倒是都值得留。Sol 便宜,Opus 的能力上限更高,尤其写代码这件事上,我更愿意选 Opus。两家最近都把原本昂贵的能力往主力模型下放,这种竞争可以再多来一点。

Haiku 5.5,便宜 worker 又多了一个好选择

Luna 已经够便宜了,A 家紧接着又发了 Haiku 5.5,定位就是高频、低成本任务,也适合给更强的模型当 subagent。Haiku 5.5 发布说明

我现在把 Haiku 5.5 和 GPT-6 Luna 放在低成本 worker 的第一梯队,能力上 Haiku 排前面。AA 的最高推理档综合成绩也是 Haiku 领先。AA:Haiku 与 Luna 对比

AA Haiku 5.5 评测:与 Luna、GLM Flash 等模型的综合能力对比,以及不同推理档位的输出 token 用量

图:Artificial Analysis,10 月 7 日 Haiku 5.5 报告。上半张看 worker 候选的能力,下半张看推理档位与输出 token 用量;后者不是美元成本。

DeepSeek、GLM、MiMo、Muse Spark 这些也还在候选里,但找便宜模型已经没必要只盯着国模了。O 家和 A 家连这一档都开始卷,对多 Agent 用户是好事。大量边界清楚的子任务,本来就没必要让最贵的模型从头跟到尾,现在可选的 worker 越来越多了。

dots:Astra 驱动的常驻助手

OpenAI 也下场做 Muse、OpenClaw、Hermes 这一类产品了。

dots 由 Astra 驱动,有自己的云电脑,也能在授权后使用本地电脑。它可以持续跟进事情,不用把每次对话都当成一次独立任务。dots 发布说明

Astra 驱动,而且聊天不计入 ChatGPT 额度,光这两点就值得试试。让 dot 发起或管理 Codex、ChatGPT Work 任务仍然正常计费,这部分别漏看。

我也很期待它能复用已有的工作上下文。每换一个助手就重新介绍自己、重新养一遍,实在太麻烦了。

O 家缩额度:还是 200 刀,预算砍半

模型发布看得挺开心,订阅这边就有点难绷了。同样每月 200 刀,O 家把额度往下砍,A 家的 Opus 5.5 却越来越值得用。

据 Kingy 对 Tibo 公告的整理,这轮 Pro 200 调整按 API 等值预算算,直接减半。Sol 降价确实能抵掉一部分消耗,但主要用 Astra 的人就没这个便宜可占了:模型没降价,可用预算少了一半。

每月 200 美元OpenAI Pro 200Claude Max 20x
额度变化新额度按报道中的 API 等值预算口径减半仍提供 Claude Pro 的 20 倍用量
老用户安排符合资格的老用户保留旧额度至 10 月 29 日,之后也转新额度按 Max 20x 的订阅规则使用
我会怎么选Sol 继续用;重度 Astra 用户得重新算账Opus 5.5 很香,值得拿来当主力

额度来源:OpenAI Pro 官方说明、Claude Max 官方说明。减半比例来自上述报道;Claude 的 20 倍以自家的 Pro 为基准,两家的倍率不能直接相除。

这刀砍得真不少。Sol 更便宜是好事,但我买的是每月 200 刀的订阅,不是“以后只能多用便宜模型”的承诺。尤其之前冲着 Astra 买 Pro 的,现在得靠换模型来维持用量,很难说体验没缩水。

有旧额度的先猛猛开蹬。接下来我会更愿意把活分给 a/,不只是留个备份了,Opus 5.5 完全有资格当主力。

Jev 火了以后,大家都开始做决策模型

System One Models 这条线最近很热闹。Jev 把决策模型带火之后,OpenAI、Cloudflare 和开源社区都在跟进:

产品 / 项目最近的进展
OpenAI Decisions API由 GPT-6 Luna 提供能力
Cloudflare Clef多模态、开放权重,提供 Workers AI 托管
llama.cpp加入决策模型服务接口,支持 Clef 等模型

来源:Decisions 文档、Clef 发布说明、llama.cpp 发布记录。

我想拿它们做的东西还挺多:model router、UI 自动化 Agent、游戏 AI,甚至自动 reviewer?尤其是那些需要频繁做选择的地方,低延迟、低成本的决策模型很适合试一试。

Clef 开放权重,llama.cpp 又跟上了支持,本地部署也有得玩了。不想自己部署就用托管服务,已经用着 O 家 API 的也可以直接看看 Decisions。比起只有 Jev 一个选择的时候,现在折腾起来方便多了。

顺便给自己打个广告,我做了一个 midscene-jev-runner,把 Jev 接进 Midscene / Playwright 的 UI 自动化里。前面提到的 UI Agent,我自己就在折腾这个方向。

npm 包名是 @chlrc/midscene-jev-runner,用法在仓库 README 里。这是我做的社区项目,感兴趣的欢迎试用、提 issue,顺手点个 star 也行。

社区的逆向和复现也值得继续跟,Jev 这类模型到底怎么实现,我还想再研究一下。

Harness 越来越模块化了

DeepSeek Harness 的官方桌面客户端已经发布,我本地也装好了,简单体验了一下,设计得确实挺好。DeepSeek Harness 官网、官方仓库

国内这几家的 Harness,dsh 是我觉得唯一能对标 Codex 的产品,比豆包、ZCode 强不少。 操作直观,模型细节也暴露得很到位。界面好用,又没有为了“简单”把该给用户的控制藏起来,这点很舒服。

而且它是完全模块化的。Everything is a Plugin,不是做完一个固定的聊天壳子,再给你留几个扩展点。对喜欢自己改工具的人来说,这种设计太有吸引力了。

单看插件化和可组合的设计,dsh 目前真有点暴打 opencode 和 pi 的意思。桌面端又把这套东西做得直观、好用,这次确实值得装一个试试。

模型与推理等级插件列表
dsh 空白会话中的模型与推理等级菜单,已隐藏账号和历史侧栏dsh 官方插件列表,展示 Agent 循环、子智能体、终端等模块
模型和推理等级直接在输入框旁边选。Agent 循环、子智能体、终端都能在插件里找到。

本机桌面客户端实拍;点击图片可查看原图细节。

Claude Code 也开放了 mods,第一方 Harness 同样开始让用户往里改。Claude Code mods

我觉得 Harness 已经是一个正式的产品分层了。选什么模型是一回事,用什么 Harness、能不能改成自己想要的样子,又是另一回事。dsh 和 Claude Code 都在往模块化走,后面这块应该会有不少好玩的东西。

运行环境也有更新。Cloudflare Sandbox、Docker Cloud Sandboxes、新版 Codex Cloud 都可以看看,云端 sandbox 已经有了好几个选择。Cloudflare Sandbox、Docker Cloud Sandboxes、Codex Cloud

做 Agent 的工程师最近应该不缺东西折腾了:模型、Harness、runtime,每一层都有新选择。

Gemini 4 Argon:Google 重回牌桌

Google 终于也跟上来了。Gemini 4 Argon 在 AA 的综合 Intelligence Index 上已经追平 Astra,只是目前还没有全面公开可用。AA:Gemini 4 Argon

AA Gemini 4 Argon 评测:与 Astra、Opus、Sol 等模型的综合能力及任务成本对比

图:Artificial Analysis,9 月 30 日 Gemini 4 Argon 报告。Argon 和 Astra 的综合成绩在同一水平;下半张的 Argon 成本按首发五折促销价计算。

成绩是挺好看的,等开放了再试。现在 Sol、Opus、Haiku、Luna 已经够用一阵,Google 再加进来,接下来估计还会继续卷。

COMMENTS # giscus
cd ../
TERMINAL $
Type "help" to see available commands.
chlorinec@blog:~/posts/ai-catch-up-after-national-day-2026 $