一、先把需求拆成任务
不要一上来就写“接一个模型”,先把功能拆开:用户提问属于对话类,附件解析属于多模态类,数据抽取属于结构化输出类。任务类型决定了后面选哪些模型。
二、按任务选模型
对话用轻量模型,结构化抽取用指令遵循强的模型,长文档用长上下文模型。OjToken 模型与价格页按文本、图像、视频、音频分类,并标注输入、输出单价与上下文长度,可以直接作为选型依据。
三、接入只改三行
保留官方 SDK,把 base_url 指向 https://api.ojtoken.ai/v1,换上 OjToken 密钥,模型 ID 填目录里的名称即可。流式输出、函数调用、图像输入都按官方格式传参。
四、看用量而不是看感觉
上线后重点看四项数据:每日调用次数、平均输入输出 token、错误率、首字延迟。错误率异常时先按排查清单处理,延迟升高时优先检查是否选用了过重的模型。
五、成本估算示例
假设某个应用每天 1 万次调用,每次平均输入 1500 token、输出 400 token,选用输入 ¥1.9、输出 ¥7.6 每百万 token 的模型:
- 输入:10000 × 1500 ÷ 1000000 × 1.9 ≈ ¥28.5;
- 输出:10000 × 400 ÷ 1000000 × 7.6 ≈ ¥30.4;
- 合计约 ¥58.9/天,月成本约 ¥1770。
把固定提示词放进缓存、把分类任务换成更轻的模型,这一步通常还能再省三成以上。上线前建议先用价格计算器把不同模型组合都跑一遍,再决定最终方案。