您的位置:首页 > 手游攻略 > Muse Spark 1.1 API 费用解析:输入、输出与缓存计费

Muse Spark 1.1 API 费用解析:输入、输出与缓存计费

作者:互联网  时间: 2026-09-24 12:20:01  

Muse Spark 1.1 API 采用按 tokens 用量计费的标准档位:每百万输入 tokens 为 1.25 美元,每百万缓存输入 tokens 为 0.15 美元,每百万输出 tokens 为 4.25 美元。它没有 Contributor 低价版本,也没有单独的长上下文附加费;具体由请求中的未缓存输入、命中缓存的输入、模型输出以及额外工具费用共同组成。

Muse Spark 1.1 官方发布页面截图

图:Meta AI Research 于 2026 年 7 月 9 日发布 Muse Spark 1.1,并同步推出 Meta Model API 公开预览。截图于 2026 年 9 月 23 日获取,来源:官方发布页

Muse Spark 1.1 最新价格表

根据 Meta Model API 官方计费页面muse-spark-1.1 与 1.2、1.3 标准版采用相同的文本 tokens 单价:

用量类型 每百万 tokens 价格
未缓存输入 1.25 美元
缓存输入 0.15 美元
输出 4.25 美元

计费没有最低消费,也不要求预先购买固定 tokens 包。流式与非流式请求使用相同单价,选择 Responses、Chat Completions 或 Messages 接口也不会改变基础 tokens 价格。

Muse Spark 1.1 属于标准档位,官方说明该档位的提示词和模型输出不会用于训练 Meta 模型。后续版本 1.2 和 1.3 提供 Contributor 低价档位,但不能把对应价格套用到 1.1;当前没有 muse-spark-1.1-contributor 这个官方模型 ID。

输入、缓存输入和输出分别指什么?

未缓存输入

输入包括用户提示词、会话历史、发送给模型的文档内容以及应用添加的系统说明。首次出现或未命中缓存的部分按每百万 1.25 美元计算。

长会话若每轮都重新发送全部历史,输入 tokens 会不断增加。使用服务端状态或合理压缩旧内容,通常比一味扩大上下文更节省费用。

缓存输入

当提示词前缀与之前请求的内容匹配并命中缓存时,对应 tokens 按每百万 0.15 美元计算。可缓存内容通常适合放在请求前部,比如长期不变的系统说明、大段固定文档或稳定的工具定义。

是否命中不能靠估算。应读取响应 usage 中的 cached_tokens,再按具体数量核算。只是在多次请求中发送相同文本,不代表服务一定把全部内容按缓存价处理。

输出

模型生成的文本按每百万 4.25 美元计算。输出单价高于输入,所以长篇生成、详细推理说明和大量结构化结果可能成为主要费用来源。为每个任务设置合理的输出上限,并在提示词中明确格式,通常比生成后再截断更有效。

费用计算公式

Muse Spark 1.1 的基础费用能够写成:

总费用 = 未缓存输入 tokens ÷ 1,000,000 × 1.25
       + 缓存输入 tokens ÷ 1,000,000 × 0.15
       + 输出 tokens ÷ 1,000,000 × 4.25
       + 额外工具费用

金额单位为美元。最终应以控制台与接口返回的 usage 数据为准。

三个具体计算例子

例一:普通问答

一次请求使用 20,000 输入 tokens,并生成 3,000 输出 tokens,没有缓存:

输入:20,000 ÷ 1,000,000 × 1.25 = 0.025 美元
输出: 3,000 ÷ 1,000,000 × 4.25 = 0.01275 美元
合计:0.03775 美元

这说明短请求单次费用不高,但高频调用会迅速累积,尤其是每轮重复发送长会话历史时。

例二:固定文档反复提问

一次请求包含 300,000 未缓存输入、700,000 缓存输入,并生成 100,000 输出 tokens:

未缓存输入:300,000 ÷ 1,000,000 × 1.25 = 0.375 美元
缓存输入:  700,000 ÷ 1,000,000 × 0.15 = 0.105 美元
输出:      100,000 ÷ 1,000,000 × 4.25 = 0.425 美元
合计:0.905 美元

若同一百万输入 tokens 全部按未缓存价格计算,输入部分就要 1.25 美元。稳定前缀能够命中缓存时,差异会很明显。

例三:接近完整上下文的任务

请求使用 1,000,000 未缓存输入 tokens,并生成 50,000 输出 tokens:

输入:1,000,000 ÷ 1,000,000 × 1.25 = 1.25 美元
输出:  50,000 ÷ 1,000,000 × 4.25 = 0.2125 美元
合计:1.4625 美元

官方不收长上下文附加费,含义是单价不因上下文变长而提高,并不是长输入免费。具体放入多少 tokens,仍按对应输入费率计算。

联网检索是否另收费?

通过 web_search 工具启用联网检索时,每 1,000 次搜索查询另收 2.50 美元,同时仍要支付模型的输入与输出 tokens 费用。一次模型请求可能发起不止一次搜索,所以不能简单按“请求次数”估算检索费用。

若业务只需要查询固定内部资料,可先使用自身检索系统筛选内容,再把必要片段发送给模型。需要实时公开信息和来源标注时,再启用接口提供的联网检索。

图片、视频和音频怎样计费?

Muse Spark 1.1 支持图片、视频、音频和 PDF 输入,但官方计费页把 Muse Spark 归入按 tokens 计费的文本模型。接口响应中的 usage 对象是核算依据,不应把 Muse Image 的每张图片价格或 Muse Voice Transcribe 的每小时价格套到 Muse Spark 1.1。

媒体文件经处理后会占用上下文。分辨率、时长、抽帧方式和提示内容都会影响请求规模。上线前应使用具体素材采样,记录 usage 与完成质量,再制定文件大小和时长上限。

请求额度和计费不是一回事

标准档位当前提供每分钟 3,000 次请求和 4,000,000 tokens 的团队额度。额度用于控制调用速度,不是免费用量。多个 API Key 共享同一团队上限,新建更多密钥不会增加 RPM 或 TPM。

达到额度后,接口会返回 HTTP 429。客户端应读取剩余额度响应头,并使用带随机抖动的指数退避。盲目立即重试既可能继续失败,也会让并发请求集中在同一时间再次触发限制。

哪些 tokens 不计费?

Meta 会为请求加入少量系统引导与运行结构。官方说明,这部分平台注入的 tokens 不向开发者收费,也不会计入 usage。开发者自己发送的系统说明、工具定义、会话历史和文件内容则属于输入用量。

所以,核对时应以响应返回的数据为准,不要用本地字符数直接换算。中文、英文、代码和结构化数据的 tokens 比例不同,同样字数不一定产生相同费用。

1.1 还值得继续使用吗?

若现有应用已经围绕 1.1 完成评测,并且需要稳定复现旧结果,能够继续保留。它与 1.2、1.3 标准版的单价相同,迁移不会因为基础费率自动省钱,收益主要来自新版本的任务成功率和工具效率。

新项目一般应先测试官方推荐的 1.3。若 1.3 用更少工具调用或更少输出完成同一任务,即使每百万 tokens 单价相同,总费用仍可能下降。正确比较方式不是只看价格表,而是记录每个真实任务的完成率、总 tokens、重试次数和人工处理时间。

Muse Spark 1.1 的价格结构很直接:输入 1.25 美元、缓存输入 0.15 美元、输出 4.25 美元,均按每百万 tokens 计算。控制成本最有效的做法是减少重复上下文、提高缓存命中、约束输出长度,并把联网检索限定在确实需要实时信息的任务中。

最新游戏

更多

Copyright©2010-2019. All rights reserved | 波波三国游戏官网|[email protected]

备案编号:湘ICP备2022015115号-4