Skip to content

模型档位与上下文窗口

一句话

模型有"大小档位"之分——越大越聪明、越贵、越慢;"上下文窗口"则决定它一次能记住多少内容。 选模型就是在这两件事之间找平衡。

🚗 模型像不同排量的车

同一家厂商往往出好几款模型,从轻快便宜到顶配强力都有。可以粗略分成三档:

档位常见名字里带的词特点适合
轻快档mini / haiku / flash便宜、快,能力够日常用聊天、翻译、简单总结、跑量
主力档sonnet / 主流 GPT 系综合最均衡,最常用写代码、复杂推理、agent 工作流
顶配档opus / pro / ultra最聪明、最贵、相对慢难题、长任务、对质量极敏感的活

一个朴素规律:越大越聪明、越贵、越慢(绝大多数情况下成立)。

模型选择是"几十倍"的变量

同样的活,用轻快档和用顶配档,账单可能差一两个数量级。所以省钱的第一招永远不是抠 prompt,而是别动不动就上顶配——先用便宜档试,不够用再往上换。

🏷️ 模型名得"一字不差"

调用时模型名是个精确字符串,不容错、不模糊匹配:大小写错、少个连字符、自己脑补一个名字,都会直接报 404 model not found

永远从控制台模型页复制名字,别手敲。具体命名套路和排错见 模型选择

哪些模型能用、单价多少,只认控制台

上游模型几乎每周都在变(新增、改名、下线),任何文档写死的清单都会很快过期。唯一可信的列表 = 控制台模型 / 定价页,按你账户所在 分组 筛一下,看到的就是你能调的。

📏 上下文窗口(Context Window)

这是新手最容易忽略、又最容易踩的一个概念。

上下文窗口 = 模型一次最多能"同时看进眼里"的 token 总量。

关键在于,这个窗口要装下的不只是你这一句话,而是:

你的输入 + 对话历史 + 贴进去的文件 + 模型这次的输出

全部加起来,不能超过模型的上下文窗口

打个比方:上下文窗口就像模型的"桌面大小"。桌面就那么大,你摊开的资料(输入+历史)越多,留给它写答案(输出)的地方就越小;资料堆到桌子放不下,它就会报错或者把早先的内容"挤掉"。

超出窗口会怎样

  • 直接报错(提示 context length exceeded 之类)
  • 或者部分客户端会自动把最早的对话历史截断,导致模型"忘了"前面说过的话

怎么应对

  • 选模型前先看它支持多大的上下文窗口(控制台 / 模型说明里有标)
  • 一次别喂超大文件,拆开喂
  • 长对话定期清历史(很多工具用 /clear),既省钱又避免撑爆窗口

窗口大小 ≠ 越大越好

大窗口模型往往更贵,而且就算窗口能装下,塞太多无关内容反而会稀释模型注意力、还多花 input 的钱。够用就行。

🖼️ 多模态:能看图、能听音的模型

普通模型只认文字,多模态模型还能"看懂"图片、有的能处理音频。控制台里带 vision / multimodal 标签的就是。

注意:文生图 / 图生图是另一类专门模型(图像生成专用模型,控制台归在出图 / 绘图类),走的是图像生成接口,不是聊天接口。详见 Nano Banana 图像生成

🚀 下一步