模型 × harness年鉴。
本机日志实测,不是厂商宣传——组织方式只用唯一站得住的单位:模型 × harness × 任务。
叙事正文把模型当成若干变量之一,并有意把细节挪开。细节住在这里:哪个模型、在哪个 harness 上、做了多久——每条结论都带着测量窗口。这里几乎没有数字来自厂商页面;凡是的,都标出来了,因为一则公告和一次测量不是同一种数字。
七个月,六个时代
每一道分界都是「工作能被委托到什么程度」的变化,而不是某个发布日期。
| 时代 | 时间 | 主力 | 工作的形态 |
|---|---|---|---|
| 试探 | 2025 秋 | cursor(模型未记录,约 0.26 亿) | 编辑器内补全 |
| 裸调 | 2025-10 → 2026-04 | iFlow:qwen3-coder-plus、glm-5、kimi-k2.5、minimax-m2.5 | 对话式,约 2.3 亿估算(未记录),零沉淀 |
| GPT-5.5 | 2026-05 → 06 | gpt-5.5(mulerun + codex,6.1 亿) | 仓库级工作开始 |
| K3 家族 | 2026-07 中 → 08 初 | k3(8.2 亿)+ k3-256k + kimi-for-coding | harness 成型期,砸穿 FT-710 |
| Flash 霸权 | 2026-08 起 | deepseek-v4-flash(40 亿,峰值单周 16 亿) | 性价比档吃下日常工程 |
| 多极竞争 | 2026-08 下 → 今 | flash 衰减至周 0.26 亿;gpt-5.6、gpt-5.5 回潮、qwen3.8-flash、qwen3.8-max-0902 | 按任务选模型 |
「霸权」内部一直在轮换挑战者,而且没有稳定下来——它在加速。W32 试过 qwen3.8-max 与 glm-5.2 未留用;W35 起新组合站稳,随后又变了。模型市场每三到四周换一轮血。锁定单一模型是明确的不利策略,而做出这个错误动作的方式,通常是把一个模型名写进配置文件。
主力在一周之内换了
各 harness 保留窗口内的调用次数。是次数不是 token——它反映注意力,不反映花费。
| harness | 领先模型(调用次数) | 变化 |
|---|---|---|
| claude-code | deepseek-v4-flash 12,402 / qwen3.8-max-0902 3,883 / qwen3.8-flash 1,077 / glm-5.2 800 | 上一任主力仍在日志里,但已不再驱动工作;qwen3.8-max-0902 在七天内接管 |
| pi | deepseek-v4-flash 4,417 / gpt-5.6 2,721 / qwen3.8-flash 1,227 / glm-5.3-flash 745 / deepseek-v4-flash-vision-exp 85 | glm-5.3-flash 在上一次普查里根本没出现;随后又多了一个视觉变体 |
| kimi-code | k3 5,891 / kimi-for-coding 2,097 / k3-256k 1,903 | 稳定——长上下文工作有固定归属 |
| codex | gpt-5.5 143 / gpt-5.6-sol 128 / deepseek-v4-flash 17 | 八月下旬起停用;总量一位数字都没动 |
| mulerun | gpt-5.5 162 / deepseek-v4-flash-free 16 | 内容生成,未变 |
匹配表
| 角色 | 实测组合 | 证据 |
|---|---|---|
| 开荒 / 新功能 | deepseek-v4-pro | 唯一新功能占比绝对多数的模型(68%) |
| 集中攻坚 | gpt-5.6-sol(codex) | 一周窗口打穿 ft8(2.35 亿)后撤出——闪电战 |
| 日常主力 | deepseek-v4-flash(claude-code + pi) | 40 亿;修复 + 分析 + 运维约 70%;claude-code 侧偏现场运维、pi 侧偏修理 |
| 主力开发 + 长上下文专项 | k3 / k3-256k(kimi-code) | k3 在 FT-710 攻坚期花掉 4.17 亿;k3-256k 的 1.65 亿几乎全投 ft8 |
| 交付 / 发布流水线 | gpt-5.6(pi)、gpt-5.5(mulerun) | 网站写作、文档、宣传片、安装包打包 |
| 分析 / 写作 | qwen3.8-flash、qwen3.8-max-0902 | 试用会话中分析类占 60%;最新进场者直取网站分析任务 |
旗舰模型买「方向」,性价比模型买「执行」,长上下文变体买「专项」,harness 买「工作方式」。同一模型装进不同 harness 会呈现完全不同的任务画像——gpt-5.6 在 codex 是攻坚队,在 pi 是发布流水线——所以选型单位是「模型 × harness × 任务」三元组,从来不是模型本身。
两种数字,分层存放
独立测评与厂商公告是不同性质的证据。它们永远不被平均,也不会并列在同一列里。
独立测评
- Artificial Analysis 智能指数——Kimi K3 57、Qwen3.8-Max 56。
- LMArena——Gemini 3 Pro 1501 Elo,首个突破 1500 的模型。
- Code Arena——GLM-5.2 编程盲测 1595 分,开源权重模型第一。
厂商口径
- DeepSeek-V4-Pro 在 Codeforces 得 3206。
- Qwen3.8-Flash 宣称在 SWE-bench Pro 上领先 Opus 4.6 达 9.1 分。
V4-Flash(OpenRouter 每百万 $0.14 / $0.27)、Qwen3.8-Flash(官方口径为其三分之一价)、GPT-5.6 Luna、Gemini 3.1 Flash-Lite——全部挤在同一个「日常工程可负担」的生态位。这种拥挤与本生态实测的用量互相印证:性价比档在数月里吃下了日常工作的绝大部分。
公开榜单回答的是「这个模型总体有多好」,它回答不了「这个模型在我的任务、我的 harness、我的代码库上有多好」。能回答第二个问题的仪器只有一件:你自己的用量日志——这也正是本系列一直坚持要快照它、标注它的原因。
日志里的名字不是模型实体
把日志标识当路由标签,不要当能力实体。
big-pickle
OpenCode 官方承认的隐身模型。它是一个真实端点,名字刻意不提供任何信息——任何针对它的评测,都是针对一个未知量的评测。
code-supernova-1-million
2025 年的隐身营销名。原渠道已下架,这意味着这个标签再也解析不到任何实体——一条指向已退役别名的日志记录。
kimi-for-coding
套餐 API 别名。两条带这个标签的调用,可能在不同时间由不同的底层模型提供,所以相邻调用之间不构成受控比较。
年鉴里每一条结论都是从这类标签上得出的。这不会让结论失效,但会给它划界:「这个标签这周用得更多」是关于路由的陈述,而「这个模型变强了」是关于能力的陈述。前者可以从日志里测出来,后者不能——把两者混为一谈,就是一份用量报告悄悄变成一份评测榜单的方式。