30B,已经是新的端侧 7B 了:AI 正在从云服务回到个人运行时
30B 级模型正在接过过去 7B 的位置,让 AI 从远程 API 演化为个人设备上的常驻运行时。本文从训练、低精度、长上下文、解码与消费级硬件几条线,讨论端侧执行器、个人 Agent、私有服务器和云端模型的新分层。
TABLE OF CONTENTS
我之前做过一个叫 MateClaw 的个人 Agent 项目,想做的是一个带人格、长期记忆和主动触发能力的个人 AI。早期设计时,端侧模型实在太弱,每次理解用户、整理记忆、决定是否行动,都只能请求远端强模型。那不是一种架构偏好,只是没得选。
也因为这段经历,我对端侧模型的认知有一段时间停在 Qwen3 那个阶段:7B 是轻量级,14B 已经比较舒服,30B 则算得上“大模型”。想认真跑 30B,就得开始计算显存、量化、上下文长度和各种运行时问题。至于能做复杂编程、调研和电脑操作的 Agent,默认答案仍然是云端模型。
这两天重新看 Meta 刚发布的 Muse Glimmer 30B,我才发现自己的坐标系有点过期了。
它是一个约 30B 的稠密多模态模型,却从一开始就瞄准消费级硬件上的本地 Agent:工具调用、编程、深度搜索和电脑操作都在它的目标任务里;官方 4-bit 版本把语言模型权重压到了 20GB 以内,并把 24GB、32GB 设备当成明确的部署档位。
这篇文章当然有点标题党。30B 并没有突然变得和过去的 7B 一样便宜,更没有追平前沿模型的能力上限。我真正想说的是:30B 正在接过过去 7B 的位置,成为个人电脑上默认值得认真考虑的主力档位。
问题也就跟着变了:为什么同样是几十 B 参数,今天的模型突然能做这么多事?为什么过去必须放在数据中心的东西,现在开始往个人电脑上搬?如果模型真的可以长期留在设备上,我们还应该把 AI 理解成一个 API 吗?
端侧模型已经不是一个档位了
以前说“端侧模型”,很容易把从手机上的 1B 模型到工作站里的 100B 模型都塞进同一个抽屉。放到今天,这个词已经太粗了。更合适的理解是一套分层运行时:
| 档位 | 更合适的角色 | 典型任务 | 自然的部署位置 |
|---|---|---|---|
| 1–3B | 端侧执行器(Edge Worker) | 分类、抽取、记忆处理、函数调用、工具路由 | 手机、浏览器、系统后台 |
| 20–35B | 个人 Agent(Personal Agent) | 推理、视觉、编程、MCP、调研、电脑操作 | PC、Mac |
| 100B+ | 私有 AI 服务器(Private AI Server) | 更强推理、内部知识、敏感数据、多人共享 Agent | 个人工作站、中小企业私有部署 |
1–3B 模型首先不该再被理解成“小号聊天机器人”。它不需要什么都懂,只要能稳定承担高频、结构化、对延迟敏感的工作,就已经很有价值。
放到 MateClaw 这类项目里,相当一部分工作已经没必要每次上云:记忆提取、事件分类、简单工具选择,甚至一小段 Agent 循环,都可以先交给端侧执行器。它当然替代不了前沿模型,但它能接住大量原本根本不值得支付一次云端调用的智能。
变化最大的还是 20–35B。这个档位过去更像“本地聊天模型”,现在却开始摸到 Agent 主脑的位置。模型不再只负责某个摘要、补全或 RAG 功能,而是和记忆、文件、工具、浏览器一起,组成一套长期驻留的个人运行时。
再往上的 100B 级模型还远谈不上大众消费品。不过当混合专家模型(MoE)、低精度和 128GB 统一内存放到一起时,它已经从“必须有一组多卡服务器”,变成了“办公室里该买一台什么工作站”的问题。
云端不会消失。它只是从默认运行位置,慢慢变成最高能力的升级层。
为什么它们过去必须待在云端?
如果只是列一遍 2026 年的新模型,这篇文章很快就会变成一份过期榜单。真正让我感兴趣的是:端侧模型过去到底卡在哪里?
我觉得可以压成四个很朴素的问题:
| 瓶颈 | 用户实际感受 | 这几年发生的变化 |
|---|---|---|
| 智能不够 | 小模型一做复杂 Agent 就露怯 | 更强的教师模型、合成数据、蒸馏、Agent 强化学习、推理时计算 |
| 模型太大 | 稍微聪明一点,消费设备就装不下 | MoE、量化感知训练(QAT)、FP4 / INT4 |
| 运行时状态太贵 | 上下文一长,KV Cache 和内存迅速膨胀 | GQA、MLA、混合注意力、FlashAttention / PagedAttention |
| 解码太慢 | 模型虽然装进去了,token 却一个个往外蹦 | 投机解码、MTP、DFlash、扩散语言模型 |
它们不是一项神奇技术带来的单点突破,而是四笔账同时开始松动。
小模型装进了更高的智能密度
几年前的小模型主要从互联网语料里学习。今天,它还可以吃到前沿教师模型生成、筛选、重写和验证过的数据。蒸馏也不再只模仿最终答案,还会学习答案之间的概率关系、推理轨迹和更具体的任务行为。
如果用一个不太严谨但很好理解的比喻:过去的小模型是在图书馆里自学,现在它有了前沿模型当私教。
后训练也变了。以前更像是教模型如何好好回答问题,现在终端、浏览器、代码仓库、工具和 Harness 本身都可以成为训练环境。模型在环境里行动,环境再用成功或失败给出反馈。于是 Harness 不只是在模型外面兜底,也开始参与塑造模型的行为。
o1、DeepSeek-R1 之后,推理时计算又给模型多加了一根伸缩杆。困难任务可以多推几步、自检、回退,再用更多推理 token 换正确率。模型能力不再全部提前固化在参数量里。
这些变化叠在一起,提高的是一种智能密度(Intelligence Density):同样几十 B 参数里,塞进了更好的数据、更强的教师模型、更成熟的推理能力,以及更偏向完成任务的 Agent 行为。
参数总量不再等于完整运行成本
模型变聪明以后,下一个问题马上出现:还是太大。
MoE 先把总参数量和实际计算量拆开。一个 100B+ 的模型可以拥有很大的专家容量,但每生成一个 token,只让路由器激活少数专家。看这类模型时,只问“多少 B”已经不够了:总参数量更接近模型容量,激活参数量才更接近每个 token 真正支付的计算成本。
量化则在拆另一笔账。30B 的 BF16 权重粗算约 60GB;换成 4-bit,裸权重会降到约 15GB。加上缩放因子、元数据、部分高精度张量和运行时状态后,现实占用会更高,但它已经从服务器显存的量级进入了个人设备可以讨论的范围。
更重要的是,量化不再只是模型发布后由社区“压一遍看看掉多少智力”。QAT、原生低精度、量化格式、算子和硬件开始一起设计。
换句话说,MoE 让“模型拥有多少能力”不再等于每次推理要算多少;低精度则让参数量不再直接等于实际占用的字节数。
Agent 真正吞掉的是运行时状态
聊天模型的上下文可能只是一段对话,长期工作的 Agent 却会不断塞进系统提示词、工具定义、文件、浏览器结果、对话历史、推理过程和工具输出。模型权重好不容易装下了,KV Cache 又把内存吃完——这件事一点也不好笑。
GQA、MLA 和混合注意力首先减少理论上需要保存的状态。GQA 让多组查询头共享更少的 KV 头;MLA 进一步把 K/V 压进更小的潜在表示;混合注意力则不再要求每一层都做昂贵的全量注意力,而是让大部分层维护便宜状态,隔几层再做一次精确的全局检索。
FlashAttention、PagedAttention 和前缀缓存解决的是另一侧:如果这些状态必须存在,就少做无意义的显存搬运,用更好的分页管理减少碎片,并复用已经算过的前缀。
这个区分对理解运行时很有用:前一组技术在减少“理论上要存多少”,后一组技术在优化“已有状态该怎么计算和管理”。
一次昂贵的前向计算,别只换回来一个 token
经典自回归模型有一个很反硬件直觉的地方:一次大模型前向计算,只生成一个 token;下一个 token,再把权重走一遍。对本地 Batch=1 推理来说,解码经常受内存带宽限制,于是机器反复搬动一大坨权重,每次却只向前挪一步。
投机解码(Speculative Decoding)、MTP、EAGLE 和 DFlash 都在尝试把这个步长做大:先用更便宜的方法猜一组未来 token,再让主模型一次并行验证。前几个猜对了,就可以一次向前走多步。
扩散语言模型更激进,它连“文本为什么必须严格从左到右生成”都想一起改掉,用块级去噪换更多并行计算。它现在还不是主流答案,但方向很清楚:模型不只要变聪明,生成一个 token 所支付的硬件成本也在被重新设计。
PC 为什么开始像一台 AI 工作站?
模型侧的几笔账松动后,硬件变化就变得很好理解。本地 LLM 真正需要的,不只是宣传页上很高的 NPU TOPS,而是:足够大的可寻址内存、足够高的内存带宽、GPU 能直接访问,以及成熟的低精度算子和运行时。
Apple、NVIDIA 和 AMD 的路线起点不同,最后却越来越像在解同一道题。
| 路线 | 最突出的优势 | 更自然的角色 |
|---|---|---|
| Apple Silicon | 高带宽统一内存,日常电脑与开发环境完成度高 | 30B 个人 Agent、低摩擦本地开发 |
| NVIDIA 独显 | 高带宽专用显存,CUDA / TensorRT / vLLM / SGLang 生态成熟 | 30B 高速推理、对性能敏感的工作负载 |
| NVIDIA Grace Blackwell / DGX Spark | CPU-GPU 一致性内存与 CUDA 生态结合 | 更大模型、私有工作站 |
| AMD Ryzen AI Max+ / Strix Halo | 64GB / 128GB UMA 与 x86,容量价格比突出 | 70B、100B MoE、多模型常驻 |
如果只是想长期舒服地跑 30B,我个人会把 48–64GB 看成更合理的甜点位,而不是卡在“刚好能装下权重”的最低容量。因为真正跑 Agent 时,内存里从来不只有模型:上下文、KV Cache、视觉编码器、草稿模型、应用本身都要抢空间。
三家最后收敛到的东西很朴素:大容量、高带宽、GPU 可以直接访问的内存。PC 也因此从“偶尔跑一下 AI 的电脑”,变成了“可以让模型长期驻留的电脑”。
从默认上云,回到本地优先
回到 Muse Glimmer,它对我来说更像一个信号,而不是这篇文章的主角。它让我重新看见:过去默认成立的四个前提——小模型不够聪明、聪明模型装不下、长上下文跑不起、装进去也太慢——正在同时松动。
未来更自然的 Agent 架构,很可能不是在本地和云端之间二选一,而是让任务按成本和敏感程度逐级升级:
flowchart TB
W["1–3B 端侧执行器<br/>记忆 / 触发 / 工具路由"] -->|需要更复杂的推理| P["20–35B 个人 Agent<br/>推理 / 视觉 / 工具"]
P -->|重型或敏感任务| S["100B+ 私有服务器"]
S -->|需要最高能力上限| C["前沿云模型"]
如果现在重新画 MateClaw 的架构,我会把最私人、最高频、最稳定的那部分智能留在设备里;只有真正需要复杂推理和最高能力上限时,才逐级向上升级。
这也是“30B 已经是新的端侧 7B”真正想表达的东西。它说的不是某个基准分数又涨了几分,也不是云端模型马上要被淘汰,而是 AI 的默认运行位置开始变化。
过去 AI 是一个 API。接下来,它可能越来越像浏览器、数据库和文件系统一样,成为长期驻留在个人设备上的基础运行时。
我们也开始不再只问“本地模型到底能不能用”。
更值得问的是:还有哪些智能,真的有必要放在云端?
参考资料
本文讨论时间点为 2026 年 8 月。模型、硬件配置与价格变化很快,准备发布前仍应重新核对一遍官方资料。