计费说明
发布时间:2026-09-24 | 浏览:1
Documentation Index
Fetch the complete documentation index at: /llms.txt
Use this file to discover all available pages before exploring further.
知识库计费方式、费用构成、计费示例与账单管理
计费起点 :从成功创建知识库开始。
扣费逻辑 : 扣费顺序 : 免费额度 > 资源包 > 按量付费 。多个知识库将会按数量扣减免费额度或资源包。 超出部分处理 :当您的免费额度和资源包消耗完成后自动转入后付费进行计费。
扣费顺序 : 免费额度 > 资源包 > 按量付费 。多个知识库将会按数量扣减免费额度或资源包。
超出部分处理 :当您的免费额度和资源包消耗完成后自动转入后付费进行计费。
扣费模式 : 免费额度 :自知识库开通时,开始计算免费额度(标准版知识库)的有效期。 资源包 :资源包按业务量级划分为不同规格,可一次性付费购买。 后付费 :系统会根据其规格,按运行时长累计从阿里云账户自动扣费, 按小时出账 。请确保账户余额充足(可通过 费用与成本 页面进行充值)。
免费额度 :自知识库开通时,开始计算免费额度(标准版知识库)的有效期。
资源包 :资源包按业务量级划分为不同规格,可一次性付费购买。
后付费 :系统会根据其规格,按运行时长累计从阿里云账户自动扣费, 按小时出账 。请确保账户余额充足(可通过 费用与成本 页面进行充值)。
停止计费 :如果不再需要某个知识库,请及时删除以停止计费。
标准版 :适用于个人 / 小规模、PoC 环境。
旗舰版 :适用于高并发、生产级环境。
RCU :RCU(Retrieval Compute Unit)是知识库检索并发能力度量单位。1 RCU ≈ 支撑在线检索最高 50 QPS。RCU 越大,可支撑并发数越高。
如何估算所需 RCU :所需 RCU 数量 = 向上取整(检索峰值 QPS 需求 ÷ 50)。例如,80 QPS 的峰值需求至少需要 2 RCU。
最高并发 :指知识库本身的核心检索性能(不含依赖链路,例如调用排序模型)。 检索知识库(旗舰版)时,如遇极端情况下模型依赖链路限流(如 Embedding、Rerank 模型等),我们将以最快速度帮您扩容相关服务,但中途可能存在少量检索请求降级,效果会有短暂的下降。
存储空间费用 :以上规格对应价格已含平台存储的费用;若您选择使用自购的 ADB-PG ,则需额外支付其费用,价格以 ADB-PG 产品定价 页为准。
变配 :按变配发生时间分段计费。变配操作本身不收费。同一知识库 1 个自然日内最多允许变配 1 次。
老用户 的免费额度有效期统一截至 2026 年 2 月 3 日 23:59,到期后将自动按量付费。
新用户 的免费额度自开通之日起 30 天内 有效。过期后剩余额度将作废,无法继续使用。
适用范围 :仅用于抵扣 标准版知识库 的规格费用,不适用于旗舰版。
扣除方式 :按 实际运行时长累计 扣除。多个知识库将会按数量扣减免费额度。 例如,同时运行 4 个标准版知识库,每小时扣除 4 小时额度。
不包含项目 :模型调用费用不在免费额度范围内,遵循模型本身的计费策略。
单个标准版知识库运行:720 小时 ÷ 1 个 = 可免费运行 720 小时
2 个标准版知识库同时运行:720 小时 ÷ 2 个 = 可免费运行 360 小时
生效时间 :资源包购买后自动生效。
有效期 :根据资源包购买套餐而定,超出有效期后,资源包中剩余的时长自动作废。
抵扣逻辑 : 抵扣顺序 : 免费额度 > 资源包 > 按量付费 。 多个同类型的资源包:优先抵扣先到期的资源包。若到期时间相同,则优先抵扣先购买的资源包。 多个知识库将会按数量扣减免费额度或资源包。 超出部分处理 :如果同类资源包全部到期或额度全部抵扣完后,若仍有超出部分,自动转为按量付费。
抵扣顺序 : 免费额度 > 资源包 > 按量付费 。
多个同类型的资源包:优先抵扣先到期的资源包。若到期时间相同,则优先抵扣先购买的资源包。
多个知识库将会按数量扣减免费额度或资源包。
超出部分处理 :如果同类资源包全部到期或额度全部抵扣完后,若仍有超出部分,自动转为按量付费。
余量监控与预警 : 查看余量 :点击 资源包 查看剩余量情况,点击 统计 查看使用信息。 设置预警 :建议设置预算预警。当资源包使用量低于预设阈值时,系统将通过短信、邮件及站内信自动触发通知。
查看余量 :点击 资源包 查看剩余量情况,点击 统计 查看使用信息。
设置预警 :建议设置预算预警。当资源包使用量低于预设阈值时,系统将通过短信、邮件及站内信自动触发通知。
退订说明 :根据阿里云退订规则,预付费商品未发生使用的部分,可按未使用额度费用申请退款;已使用的部分则无法退款。退订后,知识库转为按量付费,删除知识库可停止扣费。
知识管理(创建与更新知识库)
调用场景 :上传新文件或增量更新时,调用向量模型对文本内容进行向量化处理。
计费说明 :按新增内容的 Token 数量计费。删除文件不产生模型调用费用。
调用的模型 : 文档搜索类知识库: text-embedding-v4 或 text-embedding-v3 (文本向量模型)。 图片问答类、音视频搜索类知识库: qwen3-vl-embedding (多模态向量模型)。
文档搜索类知识库: text-embedding-v4 或 text-embedding-v3 (文本向量模型)。
图片问答类、音视频搜索类知识库: qwen3-vl-embedding (多模态向量模型)。
调用场景 : 向量化 :调用向量模型,对用户的查询(Query)进行向量化。 知识库路由(可选) :若应用关联了多个知识库并开启了知识库路由功能,系统会调用 qwen-plus 判断用户查询应路由至哪些知识库,该调用按 qwen-plus 的 Token 用量计费。 排序(可选) :调用排序模型对初步检索到的结果进行重新排序,以提升最终答案的精准度。文档搜索类知识库使用 qwen3-rerank ,图片问答类和音视频搜索类知识库使用 qwen3-vl-rerank 。
向量化 :调用向量模型,对用户的查询(Query)进行向量化。
知识库路由(可选) :若应用关联了多个知识库并开启了知识库路由功能,系统会调用 qwen-plus 判断用户查询应路由至哪些知识库,该调用按 qwen-plus 的 Token 用量计费。
排序(可选) :调用排序模型对初步检索到的结果进行重新排序,以提升最终答案的精准度。文档搜索类知识库使用 qwen3-rerank ,图片问答类和音视频搜索类知识库使用 qwen3-vl-rerank 。
计费说明 : Query 向量化费用 :按用户 输入内容 的 Token 数计费。 Rerank 排序费用(可配置关闭) :这是检索费用的主要部分。 费用取决于初步召回的切片总量 。
Query 向量化费用 :按用户 输入内容 的 Token 数计费。
Rerank 排序费用(可配置关闭) :这是检索费用的主要部分。 费用取决于初步召回的切片总量 。
初步召回 :系统根据以下参数从知识库中召回文本切片: 初步向量检索 TopK :控制基于 语义相似性 召回的相关切片数量(默认 50) 初步关键词检索 TopK :控制基于 文本精确匹配 召回的相关切片数量(默认 50)
初步向量检索 TopK :控制基于 语义相似性 召回的相关切片数量(默认 50)
初步关键词检索 TopK :控制基于 文本精确匹配 召回的相关切片数量(默认 50)
重排序 : 所有初步召回的切片,都会被送入 Rerank 模型进行排序。 费用 = 初步召回总切片数 × 平均切片 Token 数 × 模型单价 排序模型费用取决于 初步召回的总切片数 ,而非最终返回召回的切片数量。
所有初步召回的切片,都会被送入 Rerank 模型进行排序。
费用 = 初步召回总切片数 × 平均切片 Token 数 × 模型单价
最终召回 :Rerank 模型排序后,系统会根据 最终召回数量 参数(例如 5)返回相应数量的切片。
问答生成模型 :系统根据您在应用中选择的问答模型(如 qwen-plus 等)生成回答,按该模型的 Token 用量计费。
预文件解析(可选) :当用户在对话中上传文件并开启预文件解析功能时,系统会调用 qwen3-rerank 对文件内容进行排序处理,按排序模型的 Token 用量计费。
知识库路由(可选) :若应用关联了多个知识库并开启了路由功能,系统会调用 qwen-plus 进行路由判断。
AI 通用型节省计划 (推荐):覆盖 A 类全部模型(含文本向量、多模态向量、排序模型),按月承诺消费享阶梯折扣。
向量及排序模型节省计划 :专门针对向量和排序模型的节省计划,一次性购买固定金额。
操作 :上传含 50,000 Token 的文件进行向量化。
费用 :50 × 0.0005 元 / 千 Token = 0.025 元
操作 :新增含 20,000 Token 的文件。
费用 :20 × 0.0005 元 / 千 Token = 0.01 元
操作 :输入 100 Token 的查询(Query),召回 150 个相关切片(平均 500 Token / 切片)进行排序。
费用 : Query 向量化:0.1 × 0.0005 元 / 千 Token = 0.00005 元 排序 Token 数:150 个切片 × 500 Token / 切片 = 75,000 Token 排序费用(如有):75 × 0.0005 元 / 千 Token = 0.0375 元 合计 :0.00005 元(Query 向量化)+ 0.0375 元(排序)= 0.03755 元
Query 向量化:0.1 × 0.0005 元 / 千 Token = 0.00005 元
排序 Token 数:150 个切片 × 500 Token / 切片 = 75,000 Token
排序费用(如有):75 × 0.0005 元 / 千 Token = 0.0375 元
合计 :0.00005 元(Query 向量化)+ 0.0375 元(排序)= 0.03755 元
操作 :阿里云百炼智能体应用关联 4 个知识库,同一 Query 在每个知识库中默认执行一次检索(无法更改)。
费用 :0.03755 元 / 次 × 4 = 0.1502 元
场景 :14:40–15:40 期间,于 15:10 从标准版升配至旗舰版(2 RCU)。标准版和旗舰版运行时长均为 30 分钟(即 0.50 小时,保留 2 位小数)。
规格费用(14:40-15:40 期间) : 标准版:0.50 小时 × 0.03 元 / 小时 = 0.015 元 旗舰版:0.50 小时 × 2 RCU × 0.2 元 / RCU / 小时 = 0.20 元 合计 :0.215 元
标准版:0.50 小时 × 0.03 元 / 小时 = 0.015 元
旗舰版:0.50 小时 × 2 RCU × 0.2 元 / RCU / 小时 = 0.20 元
场景 :1 个标准版知识库,于 14:12 创建,并于 14:21 删除,总运行时长为 9 分钟(0.15 小时,保留 2 位小数)。
规格费用(14:12-14:21 期间) :0.15 小时 × 0.03 元 / 小时 = 0.0045 元
查询明细账单的 Token 消耗量与对应金额
在 标签管理 页面选择 资源绑定标签 。
资源选择方式选择" 输入多个资源 ID ",在产品选项卡搜索并选择" 大模型服务平台百炼: 业务空间 "并选择业务空间对应地域,资源 ID 输入框中填写 Workspace ID ,完成后点击绑定标签按钮执行操作。
在绑定标签页面中创建标签键值或使用已创建的预置标签与业务空间绑定,当完成键值输入或选择好预置标签后点击 确认 即可完成业务空间标签的绑定。
子账号可以开通知识库或查看账单吗?
标准版和旗舰版的"存储免费"具体指什么?
知识库数据量很大,旗舰版的平台存储不够用怎么办?
为什么我的排序(Rerank)费用特别高?如何降低模型调用费用?
如何彻底停止知识库的计费?删除库内文件可以吗?
错误操作:仅删除知识库内的文件,只是清除了数据,但知识库实例(作为计费主体)仍在运行,因此规格费用会持续产生。
正确操作:在控制台找到对应的知识库实例,并执行删除操作。
为什么排序模型调用次数会多于应用调用次数?
子账号可以开通知识库或查看账单吗?
标准版和旗舰版的"存储免费"具体指什么?
知识库数据量很大,旗舰版的平台存储不够用怎么办?
为什么我的排序(Rerank)费用特别高?如何降低模型调用费用?
如何彻底停止知识库的计费?删除库内文件可以吗?
为什么排序模型调用次数会多于应用调用次数?