别再一直用"自动"了,WorkBuddy按场景选模型,积分能省一大半

发布者:湖光山色 2026-8-22 10:10

你刚开始用WorkBuddy的时候,是不是也这样:打开设置,模型那一栏,看半天,不知道选哪个,最后默默选了"自动"?

我一开始也这样。结果就是:写个简单的东西,用上了最贵的模型,积分哗哗没;碰到真要深度思考的任务,自动模式又给个轻量模型,答出来的东西差一口气。

后来我把WorkBuddy里主流的几个模型挨个实测了一遍,发现一件事:选模型根本不玄乎,就是按场景选。 这篇文章不整虚的,参数、价格、实测结论全给你,最后给一套照着抄的配置。

先看5个模型的硬数据。下面所有数字,都是2026年8月11日公开信息。

先把这5个模型认个脸

模型

参数(激活)

上下文

API价格(元/百万token)

一句话

混元 Hy3

295B(21B)

256K

输入1/输出4

办公全能,WorkBuddy原配

GLM 5.2

753B

1M

代码长任务最强

Kimi K3

2.8万亿

1M

约输入20/输出100

全球最大开源,深度研究

DeepSeek V4 Flash-0731

284B(13B)

1M

输入1/输出2

性价比之王

DeepSeek V4 Pro

1.6万亿(490B)

1M

预告输入3/输出6

旗舰,还没完全体

下面按场景逐个拆。每个场景先讲清楚"这个场景到底考模型的什么",再给结论。

一、写文章

写文章考模型什么?三件事:出稿速度、中文语感、改写稳定性。注意,不考深度推理——你不需要模型证明黎曼猜想,你需要它把话说顺。

但写文章是高频场景,一篇3000字的文章,来回改几十次,每次都是一次调用。这时候成本差就被放大了

首选:混元 Hy3。 硬数据说话:它激活参数只有21B(总参数295B),MoE结构决定每次调用便宜——输入1元/输出4元每百万token,比Kimi K3便宜20倍。256K上下文对写作绰绰有余。而且它在WorkBuddy里的实测数据是任务解决率90%、首Token延迟降54%——这是自家产品里的真实表现,不是刷榜。

什么时候切旗舰? 写3000字以上、结构要严的深度长文。这时候把Kimi K3或GLM 5.2切过来立框架、理长段落。它们的SWE-bench Pro跑分(GLM-5.2 62.1%,开源最高)说明长任务执行稳,不容易写到一半跑偏。写完切回Hy3润色。

一句话总结:写文章考"快和省",Hy3性价比封顶;长文才值得切GLM/Kimi。

二、写深度研究报告

写研报考模型什么?三件事:长上下文、结构化输出、深度推理不糊弄上下文是硬门槛——材料塞不进去,再聪明也没用。

你用自动模式,大概率得到一个"差不多"的报告:结构是那么个结构,但深度不够,关键环节糊弄过去。自动模式不懂"研报"意味着什么。

首选:Kimi K3。 2.8万亿参数,全球最大开源模型,1M上下文。参数大带来的直接好处是能吃进几万字的年报,长程任务跑得稳。它在Code Arena前端榜单1679分登顶——这是百万级用户盲测的结果,不是厂商自评。

次选:GLM 5.2。 1M上下文是"工程可用"级别,实测一轮连续任务能处理88万token不掉链子SWE-bench Pro 62.1%是开源最高,FrontierSWE跟Claude Opus 4.8只差1%。写研报要读大量材料时,它的大上下文能一次吞完,不用你分段喂。

预算敏感怎么办? 用DeepSeek V4 Flash-0731跑初稿。它便宜,但质量不拉胯——Terminal-Bench 2.1得分82.7,反超自家1.6万亿参数的Pro预览版(72.1)。初稿让Flash跑,最后用Kimi K3或GLM收尾。

一句话总结:深度研报=长上下文+稳推理,Kimi K3和GLM 5.2是唯二正解。

三、搭建分析团队

搭建多AI团队(素材员、主笔、审核员分工协作)考模型什么?就一个字:

为什么?多模型协作,一次任务要调用好多次——10个子任务就是10次调用,积分消耗是单任务的几倍。全程用旗舰,一篇研报下来积分见底。

首选:DeepSeek V4 Flash-0731。 输入1元/输出2元每百万token,比Kimi K3便宜20倍。更关键的是质量不降:Agent能力是后训练出来的,不是参数堆出来的——Flash-0731在Terminal-Bench 2.1拿82.7,比自家Pro预览版还高10分。这意味着你开10个子任务,花的是别人开1个的钱,活干得还不差。

什么时候上旗舰? 团队里"终审""质控"这种最后把关的角色。把关的环节用最好的(GLM 5.2或Kimi K3),跑腿的环节全用Flash。这叫把钱花在刀刃上。

一句话总结:搭建团队,跑腿的全用Flash,把关的切旗舰——成本降一个数量级。

四、日常问答和快查

查资料、问问题、翻译句话,考模型什么?速度、稳定性、便宜。深度推理用不上。

就用混元 Hy3。 快、省、稳,WorkBuddy默认就是它。别在这上面浪费旗舰模型,杀鸡不用牛刀。

一句话总结:日常问答Hy3就够了,别让Kimi K3陪你聊闲天。

五、长文档处理

读几十页合同、几百页研报,考模型什么?上下文够不够大,以及上下文是不是真的能用

这里有个坑:很多模型标1M上下文,实际500K以后就开始劣化。能吞百万级上下文且真的能用的就三家:Kimi K3、GLM 5.2、DeepSeek V4 Flash。

求稳:GLM 5.2。 它的1M是"工程可用"级别——上面说过,实测88万token连续处理不掉链子。

求便宜:DeepSeek V4 Flash。 一样能吞1M,价格便宜一大截。

一句话总结:读长文档,求稳选GLM 5.2,求省选Flash。

那"自动"到底能不能用?

能用,但要会用。

自动模式的本意是帮你判断任务复杂度、分配合适的模型。但它的判断是通用的,不懂你的场景——不知道你是在写文章还是在写研报。它给你的永远是个"中间值",而中间值往往两头不讨好:简单任务它可能给贵模型,复杂任务它可能给轻模型。

我的建议:

- 刚上手、不确定任务类型:先用自动探路,看效果和消耗

- 任务类型一确认:立刻切手动,按上面的结论选

- 重要任务:别用自动,直接上最合适的模型

说到底,自动是个"保底",不是"最优"

现在就能用的配置清单

照着抄就行:

场景

用什么

理由

日常问答、改稿、起标题

混元 Hy3

快、省、稳,默认就是它

写3000字以上长文

框架用GLM 5.2或Kimi K3

长任务稳,结构严

写深度研究报告

Kimi K3 为主

深度推理+大上下文

搭建多AI团队

全部DeepSeek V4 Flash + 把关环节切GLM/Kimi

便宜+关键处用好模型

读超长文档

GLM 5.2(求稳)或 V4 Flash(求省)

都是1M上下文

深度硬核推理

等DeepSeek V4 Pro正式版

旗舰还没完全体

一句话总结全文

写文章Hy3、写研报Kimi/GLM、搭团队Flash、硬核推理等Pro——16个字,积分省一半。

模型更新快,但"按场景选模型"这个思路不会过时。记住一条:干什么活儿,想清楚要"快"还是要"深",然后对应去选,就不会花冤枉积分。

别再一直"自动"下去了。花30秒想一下自己在干嘛,选对模型,你的积分能省一半。

------------------------

> 备注:本文撰写于2026年8月11日。大模型领域版本迭代频繁,文中涉及的模型版本、参数、价格均以撰写当日公开信息为准,实际使用请以各平台实时信息为准。

> 特别说明:文中"DeepSeek V4 Flash"指2026年7月31日正式版公测的DeepSeek-V4-Flash-0731;"DeepSeek V4 Pro"正式版尚未发布,文中相关内容以官方预告为准。

大家都在看

相关文章