网站深度测评
Price Per Token是什么网站?
Price Per Token 是一个免费的大模型 API 价格对比网站,核心作用是让你快速查到各家 LLM 的 token 计费标准,并按价格、能力筛出适合自己用例的模型。
它提供什么
- 跨厂商价格表:覆盖 OpenAI、Anthropic、Google、Mistral 等主要厂商,资料称可对比 300+ 模型。
- 按 token 计价展示:表格列出输入价、输出价、缓存输入价,单位是每 token 美元。
- 能力筛选:可按工具调用、视觉、推理、联网搜索、PDF 输入、缓存、音频输入、开源等标签过滤(如工具调用 391 个、开源 294 个)。
- 模型详情页:每个厂商和模型都有独立页面,例如 DeepSeek、Minimax、Z-ai 等。
- 更新与订阅:页面标注最后更新日期,并提供每周价格变动、新模型发布的邮件订阅。
谁在什么情况下用它
- 做成本估算:上线前想知道某个模型的输入/输出单价,直接查表。
- 选型对比:需要推理或视觉能力时,先用能力标签过滤,再比价格。
- 跟踪降价和新模型:关注价格波动、新发布模型的人可以看更新列表或订阅邮件。
和同类站点的侧重差异
它偏“价格数据库 + 能力筛选”,而不是模型跑分或评测社区。例如需要看某个模型在编码、MMLU、GPQA 上的表现,它表格里也带这些列,但深度评测仍要另找来源;它的强项是把价格和基础能力指标放在一张表里横向比。
使用建议
先按你的硬性需求(上下文长度、是否要视觉/工具调用)过滤,再看输入输出价,注意区分“缓存输入价”和普通输入价,后者通常差很多。如果只是想知道某家厂商的定价,直接进对应厂商页更快。
如何根据输入和输出token价格估算我的LLM API成本?
用 Price Per Token 的表格可以直接估算:把“每次请求的输入 token × 输入单价”加上“输出 token × 输出单价”,再乘以月请求量,就是大致月成本。该站按 Provider、Model、Context、Input、Output、Cached Input 等列展示 300+ 模型的官方价格,并标注每日更新。
估算步骤
- 测出单次请求的平均输入与输出 token 数。输入通常包括系统提示、历史对话、检索到的文档;输出是模型生成的内容。
- 在 Price Per Token 找到对应模型行,读取 Input 和 Output 两列单价。例如表中
deepseek-chat为 164K 上下文、输入 $0.014、输出 $0.028;gpt-oss-20b为输入 $0.018、输出 $0.090。 - 用公式:单次成本 = 输入 token ÷ 1,000,000 × 输入单价 + 输出 token ÷ 1,000,000 × 输出单价。
- 乘以日请求量和 30,得到月估算。若有缓存命中,把缓存部分按 Cached Input 单价单独算,通常比普通输入低。
容易被忽略的变量
- 输入远大于输出:RAG、长文档、多轮对话场景下,输入 token 常是输出的几倍甚至几十倍,此时输入单价的影响更大。
- 缓存价格:表中 Cached Input 一列往往明显低于 Input,例如
deepseek-v4.1-flash输入 $0.003、缓存输入 $0.0028。重复的系统提示适合走缓存。 - 能力筛选:该站支持按 Tool Use、Vision、Reasoning、Caching、Open Source 等能力过滤。先按功能筛出可用模型,再比价格,避免选到便宜但缺所需能力的模型。
- 免费或极低价模型:表中部分模型输入输出显示 $0.000,如
space-bunny-alpha、minimax-m2.7;这类模型适合先做原型验证,但上线前要确认限流和稳定性。
什么情况下用这个站
需要为新项目选模型、给现有应用做降本替换、或向团队解释 API 预算时,用 Price Per Token 横向比价最快。它把 OpenAI、Anthropic、Google、Mistral、DeepSeek 等放在同一张表里,还给出 Coding、MMLU、GPQA 分数,方便在“便宜”和“够用”之间取舍。若只关心某一家官方定价,可直接看对应厂商页面;若要在多家之间快速筛选,这个聚合表更省时间。
下一步动作
先按你的月请求量和平均 token 数建一个简单表格,把候选模型的输入、输出、缓存单价填进去,算出三个场景:纯输入为主、输入输出均衡、输出为主。多数情况下,结论会随场景变化,而不是某个模型永远最便宜。
哪些LLM API提供商支持缓存输入,缓存价格如何比较?
在 pricepertoken.com 的筛选器里,直接勾选“Caching”能力,就能看到支持缓存输入的模型(资料显示当前有 210 个模型带这一标记)。表格里“Cached Input”一列就是缓存输入价格,可与同行的 Input/Output 价格直接对比。
缓存价格怎么看
- 缓存输入价通常明显低于普通输入价,适合反复发送同一段长上下文(系统提示、知识库、代码库)的场景。
- 比较时不要只看缓存单价,还要看普通输入价和输出价:有的模型缓存折扣大,但输出贵,整体未必便宜。
- 资料中的例子:deepseek-v4.1-flash 输入 $0.003、输出 $0.180、缓存输入 $0.0028;gpt-oss-20b 输入 $0.018、输出 $0.090、缓存输入 $0.003;llama-3.1-8b-instruct 输入 $0.020、输出 $0.040、缓存输入 $0.003。可见缓存价与普通输入价的差距因模型而异。
谁适合用缓存输入
- 客服/助手类应用:系统提示和知识片段固定,缓存能压低每次调用的输入成本。
- 代码或文档问答:仓库、文档作为长上下文重复使用。
- 批量处理:同一模板反复套用不同数据。
下一步
- 打开 Price Per Token,用“Caching”筛选。
- 按你的用量结构排序:输入多就看 Input 与 Cached Input 的差,输出多则重点看 Output。
- 用“Tool Use / Vision / Reasoning”等筛选叠加,先锁定满足功能要求的模型,再比价格。
若需要跨提供商横向参考官方口径,也可对照 OpenAI、Anthropic、Google DeepMind 的定价页,但缓存计费规则各家不同,以实际计费文档为准。
如何筛选同时支持工具调用和视觉能力的低价模型?
在 Price Per Token 上,用“能力筛选 + 价格排序”两步就能锁定同时支持工具调用和视觉的低价模型:先勾选 Tool Use 和 Vision 两个能力标签,再按输入价格从低到高排列表格。
具体操作
- 页面上方的 Filter by Capability 区列出各能力对应的模型数量,勾选 Tool Use(工具调用)与 Vision(视觉)后,表格只剩同时满足两项的模型。
- 表格列包含 Provider、Model、Context、Input、Output、Cached Input,以及 Coding、MMLU、GPQA 等评分,点 Input 列即可按输入 token 单价排序。
- 每行右侧的 Try / Vote 可用于快速试用或标记候选,便于后续比对。
判断低价时的注意点
- 表格里的 Input 与 Output 分开计价,有的模型输出价远高于输入价,例如资料中 deepseek-v4.1-flash 输入 $0.003、输出 $0.180,按调用结构算总成本才准确。
- 缓存输入(Cached Input)单独一列,长上下文、重复提示词多的场景应把它纳入比较。
- 价格为 $0.000 的条目多为新发布或限时状态,实际计费前需以官方价格为准。
适合谁用
需要为带图片理解又能调用外部函数的应用选型的开发者,例如做客服机器人、文档解析或 Agent 工作流时,先用能力筛选缩小范围,再按输入/输出价格排序挑出预算内的候选,比逐个翻各家定价页快得多。
下一步
把筛选结果里的 2–3 个候选,结合自己的输入输出 token 比例估算单次调用成本,再用 Try 实测效果;若更看重排行榜表现,可同时参考 MMLU、GPQA 列做取舍。
开源LLM的API价格通常比闭源模型便宜多少?
开源模型和闭源模型的 API 价格差距没有固定倍数,同代同能力下常见从“略便宜”到“便宜一个数量级”都有,极限情况甚至出现免费或近零定价。关键变量是模型规模、推理难度和供应商策略,而不是“开源/闭源”这一个标签。
用 Price Per Token 上的实际数字看差距
它的表格按输入/输出/缓存输入每百万 token 报价,能直接横向比。例如同一页面上:
| 模型 | 类型 | 输入 | 输出 |
|---|---|---|---|
| DeepSeek deepseek-v4-flash | 开源系 | $0.000 | $0.000 |
| Z-ai glm-5.3-flash | 开源系 | $0.000 | $0.000 |
| DeepSeek deepseek-chat | 开源系 | $0.014 | $0.028 |
| OpenAI gpt-oss-20b | 开源权重 | $0.018 | $0.090 |
| Meta-llama llama-3.1-8b-instruct | 开源权重 | $0.020 | $0.040 |
可以看到:小参数开源模型可以压到 $0.02 上下,而部分新出的开源大模型靠缓存或促销做到 $0.000。对照闭源旗舰(如 GPT-5、Claude、Gemini 系列)通常输入在几美元、输出十几到几十美元级别,差距往往在 10 倍到 100 倍以上。
什么情况下差距会缩小
- 开源模型参数量大、上下文长(如 1M 上下文的推理模型),托管方要覆盖 GPU 成本,输出价可能到 $0.1–$0.9,和闭源中端模型接近。
- 需要工具调用、视觉、长上下文缓存时,能提供这些能力的开源托管商更少,溢价更高。
- 闭源厂商的轻量版(mini、flash 类)会把价格拉到接近开源区间,此时差距可能只剩 2–5 倍。
怎么用它做选择
- 先按任务定能力门槛(工具调用、视觉、推理、PDF 输入),在 Price Per Token 的能力筛选里勾选,避免拿不满足需求的低价模型比价。
- 再比“输入+输出+缓存输入”三项,很多场景缓存输入占比高,单看输出价会误判。
- 最后看更新日期,开源模型降价和免费活动频繁,页面标注的“Last updated”能判断报价是否还成立。
如果只是普通文本生成、对延迟和稳定性要求不高,开源托管通常能省下一大截;如果依赖闭源独有的工具链、安全合规或最新推理能力,省下的钱可能抵不过迁移和效果损失。
怎样获取LLM API定价变动和新模型发布的通知?
要跟踪 LLM API 定价变动和新模型发布,Price Per Token 本身提供了两条直接路径:订阅它的每周邮件通讯,以及查看页面上的“New Model Releases / View all”新模型发布列表。前者推送价格变化、新发布和工具动态,后者按日期列出近期上线的模型(资料显示更新至 2026 年 10 月 4 日,并标注了 9 月下旬的一批新模型)。
具体使用情境
- 你在做成本预算,需要知道某家厂商调价:订阅周报,配合站内按厂商或模型筛选的价格页(如 Deepseek、Minimax、Z-ai 等 provider/model 页面)核对当前输入、输出、缓存输入单价。
- 你在选型阶段,想第一时间知道有没有更便宜或更强的新模型:定期看“New Model Releases”列表,再按能力标签(Tool Use、Vision、Reasoning、Web Search、PDF Input、Caching、Audio In、Open Source)过滤,缩小到符合你场景的候选。
- 你已经在用某个模型,想判断是否值得迁移:用表格里的 Context、Input、Output、Cached Input 以及 Coding、MMLU、GPQA 等列做横向对比。
选择条件
- 只要“被动接收通知”:订阅周报即可,成本最低。
- 需要“按条件查最新价格”:用站内筛选与排序,比逐个翻厂商官网快。
- 需要“跨厂商统一口径”:该站声称价格来自 OpenAI、Anthropic、Google、Mistral 等官方价格并每日更新,适合做初筛;最终签约前仍建议回厂商官方定价页确认。
可搭配的其他信息源
官方渠道通常是最权威的一手通知,例如 OpenAI、Anthropic、Google DeepMind 的发布与定价页面。做法是:用 Price Per Token 做日常监测和比价,用厂商官方渠道做最终确认。
用户评价(0)