
之前在做 AI 应用调研时我注意到一个很有意思的现象明明英伟达拥有全球最核心的 GPU 产能几乎垄断了高端 AI 芯片市场但普通开发者使用大模型时都是向 OpenAI、Anthropic、智谱、DeepSeek 这些模型厂商付费按 token 计费。英伟达为什么不亲自下场卖 token如果它既卖算力芯片又直接面向开发者售卖模型 token理论上不是可以赚到更多利润吗这个问题看似简单背后却牵扯到商业模式边界、产业链分工、生态位保护等关键逻辑。这篇文章我会从 token 计费模型、英伟达的商业定位、GPU 与模型服务的成本结构几个角度把这件事讲清楚。同时也会站在开发者视角聊聊我们日常接触 token 时需要注意的技术细节和常见坑点。1. token 到底是什么为什么 AI 厂商爱按 token 收费1.1 从“汉字拆字”理解 token在深入讨论英伟达之前先把 token 这个概念聊透。大模型本身并不直接理解文字、单词或句子它处理的是数值。为了让模型能理解文本我们需要把文本切分成一个个小的单元再映射成数字向量。这个小的单元就是 token。举个例子你好世界如果按常见的大模型分词方式这句话可能被切成若干个 token比如“你好”“” “世界”“”或者更细粒度的字节级片段。不同模型使用的 tokenizer分词器不一样切分方式也不同。有的模型一个汉字可能对应 1 个 token有的可能对应 2 个 token。英文单词通常 1 个单词可能是 1 或 2 个 token也可能被拆成多个子词。那为什么 AI 厂商喜欢按 token 收费根本原因在于token 数量直接决定了模型的计算量。输入 prompt 越长模型需要处理的前缀计算越多。输出内容越长模型需要自回归生成一步、一步地推出更多 token。上下文越长KV Cache 占用的显存也越多。所以 token 数量是最贴近真实资源消耗的计费维度。按 token 计费本质上是一种“资源用量计费模式”类似云计算的按量付费。1.2 一套典型的 token 计费结构大多数大模型 API 的计费包含两部分输入 token 和输出 token。通常输出的单价会高于输入单价因为生成阶段是逐步推理的计算成本更高。{ model: example-chat-model, prompt_tokens: 120, completion_tokens: 80, total_tokens: 200 }这就是一个常见的 API 响应片段。调用大模型接口时服务商通常会在响应里返回 usage 信息里面包含 prompt_tokens、completion_tokens、total_tokens方便开发者统计每次调用的消耗。1.3 开发者如何预估 token 消耗实际开发中我们经常需要估算一段文本大概占多少 token。这里有两种常用方式。第一种是使用模型厂商官方的 tokenizer 工具比如 OpenAI 开源了 tiktoken可以直接在 Python 中计算 token 数量import tiktoken encoding tiktoken.get_encoding(cl100k_base) text Hello, world! 你好世界 tokens encoding.encode(text) print(token 数量, len(tokens)) print(token 列表, tokens)运行这段代码会打印出文本切分后的 token 列表和数量。对开发者来说在构造 prompt 之前先估算 token能有效控制成本避免出现请求量过大导致账单飙升的情况。第二种是使用模型服务商控制台自带的 Tokenizer 工具。大多数平台都提供了可视化调试页面你可以直接输入文本系统会展示 token 切分效果。很多开发者误以为“1 个汉字 1 个 token”这个说法在部分中文大模型中成立但换成英文模型或不同分词策略时结论就变了。在做成本预估时最好用官方 tokenizer 跑一遍不要凭经验猜测。2. 英伟达的业务图谱芯片之外它到底靠什么赚钱2.1 英伟达的主营业务构成一说起英伟达很多人第一反应是“卖显卡的”。这没错但它的业务早就不是单纯卖 GPU 这么简单。从业务板块来看英伟达的收入主要来自以下几块业务板块核心产品目标客户数据中心计算A100、H100、H200、B200 等 GPU以及 DGX 服务器云厂商、大型互联网公司、科研机构专业视觉与工作站RTX 专业显卡、Omniverse 平台设计、影视、仿真行业汽车业务NVIDIA DRIVE 平台整车厂、自动驾驶公司消费级游戏显卡GeForce RTX 系列玩家、创作者而 AI 时代最受关注的是数据中心计算业务它是英伟达市值飙升的核心引擎。2.2 英伟达已经做算力服务了很多人可能不知道英伟达不只是卖物理芯片它也有了自己的云服务产品。比如 NVIDIA DGX Cloud它提供的是“GPU 算力即服务”企业可以不自己买显卡而是按周期租用英伟达的 GPU 算力在上面跑模型训练和推理任务。再比如 NVIDIA AI Enterprise这是一套企业级 AI 软件平台包含 CUDA、cuDNN、Triton Inference Server、NIM 微服务等组件帮助企业快速部署和管理 AI 工作负载。你会发现一个规律英伟达在做的是“卖算力基础设施”而不是“卖模型推理结果”。2.3 英伟达自己有哪些大模型这里要区分一下。英伟达其实也发布了若干模型比如 Nemotron 系列包括用于智能体场景的 Llama-Nemotron 模型也有用于代码生成的模型。但英伟达发布这些模型更多是为了展示 GPU 能力、完善生态工具链而不是为了成为一家“通用大模型 API 服务商”。它并不想靠“输出 token”来赚钱它想让你相信“用英伟达的 GPU 来跑 token 生成才是最省钱的”。3. 核心问题英伟达为什么不亲自售卖 token3.1 商业模式定位的冲突要理解这个问题我们需要先梳理 AI 产业链的上中下游。上游是算力硬件包括 GPU、CPU、网络设备、存储设备。英伟达是这一层的绝对霸主。中游是模型与平台包括基础大模型、模型微调平台、推理服务、云服务。OpenAI、Google、Anthropic、智谱、DeepSeek 等厂商在这一层竞争。下游是应用与终端包括各类 AI 应用、智能体、办公软件、垂直行业解决方案。如果英伟达亲自下场售卖 token会发生什么它就不再是“中立的上游供应商”而是直接变成了中游模型服务商的竞争对手。那些大模型厂商今天还在疯狂采购 H100、B200转头发现英伟达自己也推出了一个大模型 API并且按 token 收费。你觉得它们还会继续把英伟达当作最亲密的合作伙伴吗这不是猜测而是商业利益层面的必然冲突。3.2 卖铲子比淘金更稳定在淘金热里最赚钱的不一定是挖到黄金的人而是卖铲子的人。这个比喻虽然老了点但在 AI 时代依然成立。英伟达现在的核心策略就是“卖铲子”。GPU 是训练和运行大模型的必需品只要全球 AI 训练和推理需求在增长英伟达就可以源源不断地卖出高毛利芯片。相比之下卖 token 是一门需要长期运营、不断优化模型、持续投入研究和迭代的生意。模型效果不好用户会立刻流失竞争对手推出更便宜的模型定价权也会被削弱。更重要的一点是token 服务的利润率不一定比卖 GPU 更高。从公开财报可以窥见英伟达数据中心的毛利率极高。而大模型 API 服务商的利润空间反而受制于推理成本和激烈的价格战。过去一年国内外大模型 API 的价格一路走低很多厂商都在通过降价换市场。这种背景下英伟达不可能放弃高毛利的硬件核心业务转头扎进低价竞争的 token 市场。3.3 英伟达不卖 token那云厂商为什么不自己做芯片这个问题经常被拿来对比。实际上云厂商确实在尝试自研芯片。Google 有 TPU亚马逊有 Trainium 和 Inferentia微软也在推进自研 AI 芯片。但它们的逻辑和英伟达不一样云厂商本来就提供 token 服务自研芯片是为了降低采购成本和供应链风险同时提升云产品的利润空间。也就是说云厂商是“模型服务商 芯片自研者”的双重身份。而英伟达不具备模型服务商的身份也不需要冒险去摧毁自己的核心护城河。3.4 直接卖 token 会带来哪些技术挑战除了商业层面的冲突直接售卖 token 对英伟达来说也意味着进入一个完全不同的技术领域。卖 GPU 的核心是硬件工程、驱动开发、互连通信、散热设计。而卖 token 的核心是大模型训练、RLHF、推理优化、并发调度、内容安全、用户增长、API 网关、计费系统。这两套技术栈虽然有关联但能力要求差异巨大。一个典型的 token 服务需要具备以下能力高并发推理引擎能在毫秒级响应大量用户请求。弹性伸缩策略应对潮汐式的调用流量。多用户隔离和配额管理确保单个用户不会耗尽整体资源。内容安全和合规审核避免模型生成违规内容。完善的开发者平台包括文档、SDK 和调试工具。这些能力不是英伟达的强项如果硬要做需要投入巨大的人力物力而且成功的概率并不高。4. 如果英伟达真的卖 token会怎样我们可以做一个思想实验假设英伟达发布了一个“NVIDIA Token”服务会带来哪些连锁反应4.1 现有客户关系的瓦解英伟达的最大客户是谁是 OpenAI、微软、Google、亚马逊、Meta以及无数 AI 创业公司。这些客户对英伟达又爱又怕。爱的是它的 GPU 性能确实无可替代怕的是供应紧张、价格上涨。如果英伟达自己也做模型 API这些客户会立刻调整采购策略扶持 AMD、自研芯片或者其他算力渠道降低对英伟达的依赖。这条路风险极大得不偿失。4.2 生态内外的双重竞争在生态内部英伟达和云厂商之间有紧密合作。很多云厂商的实例就是搭载 NVIDIA GPU 的。在生态外部英伟达又在跟云厂商的“自研芯片方案”竞争。如果英伟达进入 token 市场合作关系会被进一步挤压。云厂商会担心自己用了英伟达的 GPU 来跑模型服务结果英伟达转头用自己的 GPU 资源做 token 服务既当供应商又当竞争对手。这样的局面会让“GPU 销售 云合作”这条路越来越难走。4.3 利润率可能反而下降卖硬件是相对直接的商业模型研发、生产、销售、交付然后产生利润。卖 token 则是高成本运营模型模型训练要烧钱工程师团队要烧钱客服支持要烧钱内容安全要烧钱。国内外的模型 API 又在疯狂打价格战token 单价一直在往下走。如果英伟达把资源从 GPU 研发转向 token 运营反而可能导致整体利润率下滑。5. 那英伟达在 AI 时代到底在卖什么5.1 卖 CUDA 生态英伟达最强的护城河之一是 CUDA 软件生态。全球有数百万开发者习惯用 CUDA 进行 GPU 编程。无论是 PyTorch、TensorFlow 还是 JAX底层调用的都可能是 CUDA 库。这种软件生态的粘性极强。如果你用了 CUDA 生态即使某天竞争对手的芯片性能追上来迁移成本依然很高。所以英伟达很舍得在软件生态上投入比如开源大量库、提供开发者培训、举办 GTC 大会。5.2 卖一站式 AI 基础设施英伟达现在更愿意做的是“AI 工厂”的解决方案商。从芯片到服务器从网络到存储从集群管理到推理框架英伟达希望提供一个完整的 AI 基础设施方案。企业只需要购买这个方案就可以快速搭建自己的 AI 平台而不需要自己处理底层软硬件的复杂适配。这种模式的核心诉求是让英伟达成为 AI 时代最底层的“基础设施供应商”。它不需要依赖某一个具体的模型产品赚钱因为无论哪家模型公司赢英伟达都能通过底层硬件获利。5.3 英伟达的“免费 token”是什么这里要提一个容易混淆的概念。有些开发者会搜索“英伟达免费 token”其实这不是英伟达在售卖 API token而是英伟达在 NVIDIA NIM、NVIDIA Developer Program 等平台上提供的免费试用额度或演示资源。比如英伟达的 NIM 微服务提供了推理服务的容器化部署方案开发者在一些免费资源配额内可以快速体验模型推理能力。这种“免费试用”和直接售卖 token 是两码事。它更像是一种生态培育手段让开发者先体验英伟达的推理软件平台熟悉之后再到云环境或企业环境购买完整解决方案。6. 开发者视角理解 token 计费避免踩坑虽然不是所有人都会去搭建一套大模型 API 服务但作为开发者理解 token 计费对日常开发非常有帮助。我结合常见的报错场景整理了下面这些高频问题。6.1 token 用量如何计算计算 token 用得最多的地方是成本预估。以大模型 API 调用为例影响 token 用量的变量主要有几个系统提示词system prompt的长度上下文的长度用户输入的长度模型输出内容的长度如果你的应用需要频繁调用大模型最好在服务端记录每次调用的 usage 信息按用户或按任务维度统计 token 消耗。下面是统计 token 用量的一个简单思路def log_token_usage(user_id, task_id, usage): total_tokens usage.get(total_tokens, 0) prompt_tokens usage.get(prompt_tokens, 0) completion_tokens usage.get(completion_tokens, 0) print( f用户 {user_id} 任务 {task_id} f消耗 token {total_tokens} f(输入 {prompt_tokens} / 输出 {completion_tokens}) )在实际项目中可以将这些数据写入日志或数据库用于后续的成本分析和配额控制。6.2 token 失效是什么意思开发中经常听到“token 失效”的说法。这里要区分两种情况。一种是 API Key 过期。很多模型平台颁发的 API Key 有有效期到期后请求会返回 401 Unauthorized提示 invalid token 或 authentication failed。另一种是会话 token 失效比如在单点登录系统里JWT 过期导致登录态失效需要重新登录。这两种场景其实都和“大模型 token 计费”无关。前者属于密钥管理后者属于用户认证体系。6.3 cookie、session 与 token 的区别有一些初学者会混淆 cookie、session 和 token。简要说一下cookie 是存储在浏览器端的少量数据每次请求自动携带。session 是存储在服务端的会话数据通过 session id 关联用户状态。token 是一种凭证通常由服务端签发客户端保存后随请求发送服务端校验其有效性。在 AI 应用里token 往往用于两层含义一是大模型的文本切分单元二是认证凭证。遇到“token 过期”这类问题要先确认说的是哪一层含义再对症排查。6.4 常见 token 报错及处理结合平时开发经验我整理了一张 token 相关报错的排查表问题现象常见原因解决思路401 Unauthorized: invalid tokenAPI Key 错误或已过期检查密钥是否有权限重新生成并配置token 数量超过模型上下文限制prompt 长度超出模型窗口做 prompt 截断、摘要压缩或分段处理token 消耗过快、账单异常循环调用或未做重试限制增加调用频率限制设置单用户配额token exchange failed认证服务端异常或网络不通检查认证服务地址、网络策略和服务可用性token endpoint returned 403 forbidden服务端策略拒绝该请求来源检查账号区域、访问策略、请求来源 IP 是否被服务商允许credits 兑换 token 比例不清晰平台按积分/额度方式计费查阅平台官方计费文档按实际模型定价测算注意遇到 403 forbidden 这类报错时首先要检查服务商是否允许你所在区域的账号访问以及请求来源 IP 是否符合服务商策略。任何绕过服务商区域限制的做法都不可取不仅违反平台条款也可能带来安全风险。正确的做法是使用服务商认可的访问方式或联系平台获取官方支持。6.5 如何在代码中避免 token 超限调用大模型时一个非常常见的问题就是“prompt too long”。解决思路通常有这几种提前估算 prompt 的 token 数量超过阈值前进行截断。对长文本做摘要保留关键信息。使用支持更长上下文的模型。把长文本拆分成多个片段分批处理。下面是一个简单的长度预检示例MAX_INPUT_TOKENS 3000 def validate_prompt(prompt, tokenizer): token_count len(tokenizer.encode(prompt)) if token_count MAX_INPUT_TOKENS: raise ValueError(fprompt 过长当前 {token_count} token超过限制 {MAX_INPUT_TOKENS}) return token_count在实际工程中还可以在异常捕获里增加降级逻辑比如提示用户缩短输入或自动触发摘要任务。7. 英伟达与 token 的产业分工谁在赚哪一份钱到现在我们已经把英伟达不卖 token 的原因拆得很清楚了。总结一下核心逻辑可以归纳为三点。7.1 产业链定位决定商业模式英伟达希望做 AI 时代的算力基础设施供应商它赚的是“芯片 软件栈 云计算”的钱。而 token 售卖属于模型服务层的生意需要直接面向开发者、面对用户运营和英伟达目前的商业模式存在结构性冲突。7.2 生态保护决定合作边界英伟达的大客户里有大量模型服务商。如果英伟达亲自卖 token就相当于和客户竞争。这不是能力问题而是信任问题。一旦客户产生“英伟达会抢我生意”的顾虑英伟达的芯片优势也会被削弱。7.3 利润结构决定选择理性GPU 是高毛利产品而 token 服务正面临激烈的价格战。从商业收益角度看英伟达没有理由主动进入一个毛利率下降、竞争惨烈、且可能破坏现有主业的赛道。8. 关注 token也关注产业链通过这篇文章我们清楚了几个关键点token 是大模型的文本切分单元也是 AI API 计费的核心维度。按 token 计费的本质是按资源消耗计费。英伟达不是没能力卖 token而是它更适合做 GPU 和算力基础设施供应商。英伟达的战略是通过 CUDA 生态、AI Enterprise 软件栈、DGX Cloud 等方式锁定 AI 产业链最底层的位置。对开发者来说理解 token 不只是为了读懂账单。在设计 AI 应用时token 估算、上下文管理、成本控制和异常处理都是真实落地时绕不开的工程问题。只有理解了 token 的经济学才能做出既好用又可控成本的 AI 产品。至于未来英伟达会不会推出一款“英伟达自家大模型 API”我认为不会轻易发生。更大的可能是英伟达继续用硬件、软件和生态推动整个 AI 产业向前走让更多玩家在模型和应用的赛道上去竞争。而我们会继续一边用着 GPU 加速的算力一边为大模型的 token 买单。