INPUT输入 Token提示词、历史消息、代码和工具结果。
OUTPUT输出 Token模型生成的文本、代码和结构化结果。
CACHE缓存 Token部分模型使用独立缓存价格。
MULTI分组倍率基础消费最终乘以 Key 所在分组倍率。
核心公式
模型价格、使用量和分组倍率共同决定扣费。
基础模型消费 × API Key 分组倍率 = 最终 Credit 消费文本模型的基础消费通常由 Input、Output 和 Cache Token 分别计算后相加。
Token 类型
一次请求可能包含三种主要 Token。
Input Token
用户问题、系统提示词、历史消息、代码、工具结果和检索内容都可能计入输入。
Output Token
模型生成的文字、代码、结构化结果和工具参数通常计入输出。
Cache Token
部分上游支持缓存读取或缓存写入,并使用独立价格。具体以模型价格页和消费日志为准。
文本模型示例
按每 1M Token 的价格换算。
假设模型基础价格
- Input:1 Credit / 1M Token
- Output:4 Credit / 1M Token
- 本次输入:100,000 Token
- 本次输出:20,000 Token
计算示例
Input: 100,000 / 1,000,000 × 1 = 0.1 Credit Output: 20,000 / 1,000,000 × 4 = 0.08 Credit 基础消费: 0.1 + 0.08 = 0.18 Credit
分组倍率
同一基础消费在不同分组中的结果。
| 基础消费 | 分组倍率 | 最终扣除 | 说明 |
|---|---|---|---|
| 0.18 Credit | 0.2× | 0.036 Credit | 基础消费乘以 0.2 |
| 0.18 Credit | 1× | 0.18 Credit | 与基础消费一致 |
| 0.18 Credit | 2× | 0.36 Credit | 基础消费乘以 2 |
充值价格关系
Credit 与实际人民币购买成本。
充值比例
OmniDino 当前采用 1 RMB = 1 USD Credit。支付 ¥100,可获得 100 Credit。
实际人民币消耗
如果一次请求扣除 0.18 Credit,则对应消耗约 ¥0.18 的已购买额度;0.2× 分组扣除 0.036 Credit,对应约 ¥0.036。
Coding Agent
为什么 Codex 和 Claude Code 更容易消耗大量 Token?
长上下文
项目文件、历史对话、系统说明和工具输出会反复进入上下文。
多轮执行
一次任务可能包含分析、读取、修改、测试和复核等多轮模型调用。
工具结果
终端输出、代码差异和错误日志会增加输入 Token,并可能触发新的推理。
建议为 Agent 工具创建独立 Key,设置合理额度,并定期检查消费记录。
图片与其他模型
并非所有能力都按文本 Token 计费。
图片生成
通常按模型、尺寸、质量、生成数量或上游计费单位扣除。
音频模型
可能按音频时长、字符、请求或模型单位计费。
Embedding / Rerank
Embedding 常按输入 Token,Rerank 可能按 Token、请求或文档数量计费。
常见问题
消费与 Token FAQ。
客户端可能使用本地估算器;实际扣费通常根据上游返回、网关计费和模型规则计算。工具、缓存和协议适配也会产生差异。
Tokens/s 代表生成速度,不直接改变 Token 数量。最终消费取决于实际用量、模型价格和分组倍率。
检查是否使用了高输出价格模型、Agent 多轮调用、过长历史上下文、图片任务或较高倍率分组。
进入 OmniDino 控制台的日志、使用记录或明细页面,查看时间、模型、Token、倍率和扣费。