资讯 文档
技术能力
语音技术
文字识别
人脸与人体
图像技术
语言与知识
视频技术

端到端语音语言大模型

端到端语音语言大模型

百度端到端语音语言大模型的费用由两部分构成:模型调用 Token 计费和搜索增强调用次数计费。调用接口时会自动开启搜索增强,以实现联网检索与实时信息获取。因此,请确保模型资源(Pro 版或 Lite 版)和搜索增强资源均有余量或已开启后付费,以免调用失败。

端到端语音语言大模型与大模型实时语音交互-搜索增强都支持"按Token包/次数包预付费"与"按调用量后付费"两种付费模式。

  • 预付费:按Token包/次数包预付费,适合业务中对端到端语音语言大模型需求量较明确的用户选择。用户可同时购买多个包叠加使用。
  • 后付费:按调用量后付费,更适合对端到端语音语言大模型需求量尚处于探索期的用户选择,也可作为预付费的兜底方案。

用户产生调用时会优先消耗免费调用额度,待免费调用额度耗尽时开始消耗Token包/次数包内额度。当Token包/次数包内剩余额度为零时,系统会自动切换为“按调用量阶梯后付费”的计费策略;直至账户内余额不足以支付因调用产生的费用,此时端到端语音语言大模型服务暂停,用户则无法正常使用端到端语音语言模大型服务。用户重新购买资源包或给账户充值后,端到端语音语言大模型服务将恢复正常。

端到端语音语言大模型(Pro)

端到端语音语言大模型(Pro)按消耗Token量计费,支持“按Token包预付费”和“按消耗Token量后付费”两种付费方式。

价目表-按Token包预付费

用户购买后即可直接使用,Token包购买之日起一年内有效,具体价格如下:

Token包规格(千tokens) 价格(元) 单价(元/千tokens)
2000 350 0.175
10000 1700 0.17
50000 7500 0.15
100000 14000 0.14
1000000 125000 0.125

价目表-按调用量后付费

按调用量后付费方式。系统按用户实际使用实时扣费,输入输出价格不同,Token类型分为音频和文本价格也不同,具体价格如下:

Token调用量 Token类型 价格(元/千tokens)
0-∞ 输入-音频 0.064
0-∞ 输入-文本 0.008
0-∞ 输出-音频 0.24
0-∞ 输出-文本 0.064

端到端语音语言大模型(Lite)

端到端语音语言大模型(Lite)按消耗Token量计费,支持“按Token包预付费”和“按消耗Token量后付费”两种付费方式。

价目表-按Token包预付费

用户购买后即可直接使用,Token包购买之日起一年内有效,具体价格如下:

Token包规格(千tokens) 价格(元) 单价(元/千tokens)
2000 70 0.035
10000 340 0.034
50000 1500 0.03
100000 2800 0.028
1000000 25000 0.025

价目表-按调用量后付费

按调用量后付费方式。系统按用户实际使用实时扣费,输入输出价格不同,Token类型分为音频和文本价格也不同,具体价格如下:

Token调用量 Token类型 价格(元/千tokens)
0-∞ 输入-音频 0.016
0-∞ 输入-文本 0.002
0-∞ 输出-音频 0.06
0-∞ 输出-文本 0.016

大模型实时语音交互-搜索增强

搜索增强按调用次数计费,支持“按次数包预付费”和“按调用次数后付费”两种付费方式。

价目表-按次数包预付费

用户购买次数包后即可直接使用,次数包购买之日起一年内有效,具体价格如下:

次数包规格 价格(元) 单价(元/次)
10000 352 0.0352
100000 3420 0.0342
1000000 30600 0.0306

价目表-按调用量后付费

按调用次数后付费方式。系统按用户实际使用实时扣费,具体价格如下:

调用次数 单价(元/次)
0-∞ 0.036

并发说明

开通付费后,端到端语音语言大模型支持10并发。 免费测试支持并发详见 端到端语音语言大模型免费额度

费用计算示例

示例一

某企业月度稳定调用端到端语音基础模型,月度总调用Token量约12000千tokens,为节省成本选择预付费叠加购包,所需支付的费用计算如下:

1700元(10000千Token包)+ 350元(2000千Token包)= 2050元

示例二

某公司业务中使用端到端功能,测试期间请求输入了300 Token的音频+100 Token的文本(其中包含system prompt),输出了300 Token的音频+80 Token的文本,使用了1次搜索增强。无免费剩余额度,所需支付的费用计算如下:

300*0.064/1000(输入音频)+100*0.008/1000(输入文本)+300*0.24/1000(输出音频)+80*0.064/1000(输出文本)+1*0.036(搜索增强)=0.13312元

上一篇
免费测试资源
下一篇
大模型声音复刻