分册二 · 年鉴

模型 × harness年鉴。

本机日志实测,不是厂商宣传——组织方式只用唯一站得住的单位:模型 × harness × 任务。

七个月六个时代 主力一周内换人 两种口径分层存放

BG1SB  ·   ·  约 4 分钟阅读

叙事正文把模型当成若干变量之一,并有意把细节挪开。细节住在这里:哪个模型、在哪个 harness 上、做了多久——每条结论都带着测量窗口。这里几乎没有数字来自厂商页面;凡是的,都标出来了,因为一则公告和一次测量不是同一种数字。

七个月,六个时代

每一道分界都是「工作能被委托到什么程度」的变化,而不是某个发布日期。

时代时间主力工作的形态
试探2025 秋cursor(模型未记录,约 0.26 亿)编辑器内补全
裸调2025-10 → 2026-04iFlow:qwen3-coder-plus、glm-5、kimi-k2.5、minimax-m2.5对话式,约 2.3 亿估算(未记录),零沉淀
GPT-5.52026-05 → 06gpt-5.5(mulerun + codex,6.1 亿)仓库级工作开始
K3 家族2026-07 中 → 08 初k3(8.2 亿)+ k3-256k + kimi-for-codingharness 成型期,砸穿 FT-710
Flash 霸权2026-08 起deepseek-v4-flash(40 亿,峰值单周 16 亿)性价比档吃下日常工程
多极竞争2026-08 下 → 今flash 衰减至周 0.26 亿;gpt-5.6、gpt-5.5 回潮、qwen3.8-flash、qwen3.8-max-0902按任务选模型
推断 · 挑战者轮换从未停止

「霸权」内部一直在轮换挑战者,而且没有稳定下来——它在加速。W32 试过 qwen3.8-max 与 glm-5.2 未留用;W35 起新组合站稳,随后又变了。模型市场每三到四周换一轮血。锁定单一模型是明确的不利策略,而做出这个错误动作的方式,通常是把一个模型名写进配置文件。

主力在一周之内换了

各 harness 保留窗口内的调用次数。是次数不是 token——它反映注意力,不反映花费。

harness领先模型(调用次数)变化
claude-codedeepseek-v4-flash 12,402 / qwen3.8-max-0902 3,883 / qwen3.8-flash 1,077 / glm-5.2 800上一任主力仍在日志里,但已不再驱动工作;qwen3.8-max-0902 在七天内接管
pideepseek-v4-flash 4,417 / gpt-5.6 2,721 / qwen3.8-flash 1,227 / glm-5.3-flash 745 / deepseek-v4-flash-vision-exp 85glm-5.3-flash 在上一次普查里根本没出现;随后又多了一个视觉变体
kimi-codek3 5,891 / kimi-for-coding 2,097 / k3-256k 1,903稳定——长上下文工作有固定归属
codexgpt-5.5 143 / gpt-5.6-sol 128 / deepseek-v4-flash 17八月下旬起停用;总量一位数字都没动
mulerungpt-5.5 162 / deepseek-v4-flash-free 16内容生成,未变

匹配表

角色实测组合证据
开荒 / 新功能deepseek-v4-pro唯一新功能占比绝对多数的模型(68%)
集中攻坚gpt-5.6-sol(codex)一周窗口打穿 ft8(2.35 亿)后撤出——闪电战
日常主力deepseek-v4-flash(claude-code + pi)40 亿;修复 + 分析 + 运维约 70%;claude-code 侧偏现场运维、pi 侧偏修理
主力开发 + 长上下文专项k3 / k3-256k(kimi-code)k3 在 FT-710 攻坚期花掉 4.17 亿;k3-256k 的 1.65 亿几乎全投 ft8
交付 / 发布流水线gpt-5.6(pi)、gpt-5.5(mulerun)网站写作、文档、宣传片、安装包打包
分析 / 写作qwen3.8-flash、qwen3.8-max-0902试用会话中分析类占 60%;最新进场者直取网站分析任务
推断 · 选型单位

旗舰模型买「方向」,性价比模型买「执行」,长上下文变体买「专项」,harness 买「工作方式」。同一模型装进不同 harness 会呈现完全不同的任务画像——gpt-5.6 在 codex 是攻坚队,在 pi 是发布流水线——所以选型单位是「模型 × harness × 任务」三元组,从来不是模型本身。

两种数字,分层存放

独立测评与厂商公告是不同性质的证据。它们永远不被平均,也不会并列在同一列里。

独立测评

  • Artificial Analysis 智能指数——Kimi K3 57、Qwen3.8-Max 56。
  • LMArena——Gemini 3 Pro 1501 Elo,首个突破 1500 的模型。
  • Code Arena——GLM-5.2 编程盲测 1595 分,开源权重模型第一。

厂商口径

  • DeepSeek-V4-Pro 在 Codeforces 得 3206。
  • Qwen3.8-Flash 宣称在 SWE-bench Pro 上领先 Opus 4.6 达 9.1 分。
事实 · 性价比档是最硬的公开叙事

V4-Flash(OpenRouter 每百万 $0.14 / $0.27)、Qwen3.8-Flash(官方口径为其三分之一价)、GPT-5.6 Luna、Gemini 3.1 Flash-Lite——全部挤在同一个「日常工程可负担」的生态位。这种拥挤与本生态实测的用量互相印证:性价比档在数月里吃下了日常工作的绝大部分。

论点 · 只有你自己的日志在测量你的工作

公开榜单回答的是「这个模型总体有多好」,它回答不了「这个模型在我的任务、我的 harness、我的代码库上有多好」。能回答第二个问题的仪器只有一件:你自己的用量日志——这也正是本系列一直坚持要快照它、标注它的原因。

日志里的名字不是模型实体

把日志标识当路由标签,不要当能力实体。

big-pickle

OpenCode 官方承认的隐身模型。它是一个真实端点,名字刻意不提供任何信息——任何针对它的评测,都是针对一个未知量的评测。

code-supernova-1-million

2025 年的隐身营销名。原渠道已下架,这意味着这个标签再也解析不到任何实体——一条指向已退役别名的日志记录。

kimi-for-coding

套餐 API 别名。两条带这个标签的调用,可能在不同时间由不同的底层模型提供,所以相邻调用之间不构成受控比较。

推断 · 为什么这对测量重要

年鉴里每一条结论都是从这类标签上得出的。这不会让结论失效,但会给它划界:「这个标签这周用得更多」是关于路由的陈述,而「这个模型变强了」是关于能力的陈述。前者可以从日志里测出来,后者不能——把两者混为一谈,就是一份用量报告悄悄变成一份评测榜单的方式。