主题
模型档位与上下文窗口
一句话
模型有"大小档位"之分——越大越聪明、越贵、越慢;"上下文窗口"则决定它一次能记住多少内容。 选模型就是在这两件事之间找平衡。
🚗 模型像不同排量的车
同一家厂商往往出好几款模型,从轻快便宜到顶配强力都有。可以粗略分成三档:
| 档位 | 常见名字里带的词 | 特点 | 适合 |
|---|---|---|---|
| 轻快档 | mini / haiku / flash | 便宜、快,能力够日常用 | 聊天、翻译、简单总结、跑量 |
| 主力档 | sonnet / 主流 GPT 系 | 综合最均衡,最常用 | 写代码、复杂推理、agent 工作流 |
| 顶配档 | opus / pro / ultra | 最聪明、最贵、相对慢 | 难题、长任务、对质量极敏感的活 |
一个朴素规律:越大越聪明、越贵、越慢(绝大多数情况下成立)。
模型选择是"几十倍"的变量
同样的活,用轻快档和用顶配档,账单可能差一两个数量级。所以省钱的第一招永远不是抠 prompt,而是别动不动就上顶配——先用便宜档试,不够用再往上换。
🏷️ 模型名得"一字不差"
调用时模型名是个精确字符串,不容错、不模糊匹配:大小写错、少个连字符、自己脑补一个名字,都会直接报 404 model not found。
永远从控制台模型页复制名字,别手敲。具体命名套路和排错见 模型选择。
哪些模型能用、单价多少,只认控制台
上游模型几乎每周都在变(新增、改名、下线),任何文档写死的清单都会很快过期。唯一可信的列表 = 控制台模型 / 定价页,按你账户所在 分组 筛一下,看到的就是你能调的。
📏 上下文窗口(Context Window)
这是新手最容易忽略、又最容易踩的一个概念。
上下文窗口 = 模型一次最多能"同时看进眼里"的 token 总量。
关键在于,这个窗口要装下的不只是你这一句话,而是:
你的输入 + 对话历史 + 贴进去的文件 + 模型这次的输出全部加起来,不能超过模型的上下文窗口。
打个比方:上下文窗口就像模型的"桌面大小"。桌面就那么大,你摊开的资料(输入+历史)越多,留给它写答案(输出)的地方就越小;资料堆到桌子放不下,它就会报错或者把早先的内容"挤掉"。
超出窗口会怎样
- 直接报错(提示 context length exceeded 之类)
- 或者部分客户端会自动把最早的对话历史截断,导致模型"忘了"前面说过的话
怎么应对
- 选模型前先看它支持多大的上下文窗口(控制台 / 模型说明里有标)
- 一次别喂超大文件,拆开喂
- 长对话定期清历史(很多工具用
/clear),既省钱又避免撑爆窗口
窗口大小 ≠ 越大越好
大窗口模型往往更贵,而且就算窗口能装下,塞太多无关内容反而会稀释模型注意力、还多花 input 的钱。够用就行。
🖼️ 多模态:能看图、能听音的模型
普通模型只认文字,多模态模型还能"看懂"图片、有的能处理音频。控制台里带 vision / multimodal 标签的就是。
注意:文生图 / 图生图是另一类专门模型(图像生成专用模型,控制台归在出图 / 绘图类),走的是图像生成接口,不是聊天接口。详见 Nano Banana 图像生成。
🚀 下一步
- 模型选择——挑模型的实操步骤和排错
- Token 与计费单位——窗口里装的"token"是什么
- 渠道与多档价格——同一个模型为什么有好几个价