本指南面向负责 AI 资源预算规划与成本控制的系统管理员。
算粒消耗估算方法
Agent 执行估算
Agent 执行一次(一问一答)的总算粒 = 意图识别消耗算粒 + 所有提示词模板消耗算粒 + 所有 AI 操作消耗的算粒 + 最终内容整合输出消耗的算粒。
各阶段算粒数 = 输入字符数 × 字符 token 转换比例(中文按 1.2,英文按 1.3)。
| 阶段 | 说明 |
|---|---|
| 意图识别 | 输入内容一般为用户在 Agent 输入框下达的指令,字符数一般不会超 200 字;输出为 Agent 所要执行的技能及操作,字符数也不会太大,可按 1000 token 进行估算 |
| 最终内容整合 | 输入内容一般为 Agent 执行中所有执行的操作输出的总和,可直接估算其字符数,输出一般为用户指令的内容 |
| 提示词模板 | 输入内容为提示词模板中配置的场景变量预期承接的内容,可根据变量含义估算字符数,输出为模板中定义的输出内容 |
| AI 操作 | 先拆解一次用户指令会执行多少 AI 操作,然后基于复杂度参考消耗区间进行估算 |
AI 操作消耗参考:
| AI 操作 | 消耗估算(算粒/次) |
|---|---|
| 互联网搜索 | 0.5-1 |
| 创建对象数据类操作(创建客户、日程等) | 0.12-0.5 |
| 查询对象数据类操作 | 0.3-1 |
| 知识库检索类操作 | 0.2-0.4 |
| 文本解析成文字 | 根据文件类型与文档分辨率动态使用解析模型 |
Flow 估算
基于 Flow 设计,识别 Flow 中使用的 AI 操作以及提示词模板,并估算各节点的算粒消耗。Flow 中提示词模板及 AI 操作的计费参考上表,与在 Agent 中使用时的计费逻辑一致。
RAG 知识切片向量化入库
在使用知识库做智能问答或检索知识生成内容时,需要考虑知识切片向量化入库的成本,以及基于用户问题召回相关知识切片的成本。
切片向量化入库参考:
- 文档:PDF 文件 0.1 算粒/页。
- 图片:0.1 算粒/张。
场景案例
以下额度消耗为正常使用的均值,仅作参考,实际使用中额度消耗量可能根据用户要求和任务复杂度而波动。
| 场景 | 估算案例 | 使用模型 | 预估算粒消耗 |
|---|---|---|---|
| 日常客服对话 | 一问一答,智能客服检索知识库内容后回答问题 | deepseek-v3.2 | 0.3 算粒 |
| 长文字摘要 | 输入 5 万字,输出 2000 字 | deepseek-v3 | 1.4 算粒 |
| 客户情报收集/洞察 | 搜集工商信息、CRM 信息、联网搜索信息对客户/企业做全方位洞察 | deepseek-v3.2 | 1.2 算粒 |
| 周日报摘要 | 总结一周 10 条销售记录 | deepseek-v3.2 | 0.1 算粒 |
| 内容质检 | 对销售填写的销售记录/外勤/商机跟进的内容质量进行质检,每次约输入 300 字 | deepseek-v3 | 0.06 算粒 |
| 知识库问答 | 基于知识库的智能问答 | deepseek-v3 | 0.4 算粒/次 |
| 文件解析 | 将文件转成文字并按要求摘要,普通精度要求,文件共 10 页,2 万字,输出 200 字关键信息 | deepseek-v3.2 | 约 0.8 算粒/次 |
成本控制建议
| 方法 | 说明 |
|---|---|
| 选择合适的模型 | 简单任务使用低价模型,复杂任务使用高端模型 |
| 控制上下文长度 | 限制历史对话轮数,避免上下文无限增长 |
| 优化提示词与指令 | 精简输入内容,减少无效 token |
| 批量处理 | 合并多个小任务,减少调用次数 |
消耗过快排查
| 消耗快原因 | 详细说明 | 解决方案 |
|---|---|---|
| 使用高端模型 | Deepseek-r1、Doubao seed2.0 pro 等高端模型价格较高 | 进行 A/B test 评估是否必须使用高端模型,评估是否有经济模型达到同样效果 |
| 上下文过长 | 历史对话不断累积,每轮输入 token 增加 | 定期重置会话,控制上下文长度 |
| 频繁调用 | 高频调用导致累计消耗增加 | 合并任务,减少调用次数 |
| 多轮推理循环 | 即使简单任务也会触发多次"思考 → 行动 → 观察"循环,每轮都注入大量提示词与工具定义 | 精简工具挂载,只保留当前任务所需工具;同时根据任务复杂度优化指令,避免 AI 进行不必要的动作规划和执行 |