尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
AI Agent_10 Token 到底是什么、怎么来的、为什么这么重要
一、什么是 Token先建立直觉Token词元 大模型处理语言时的最小单位。它既不是 字也不完全是 词而是分词器Tokenizer从文本里切出来的 小块。示例我喜欢 AI 可能被切成 3 个 token[我][喜欢][AI]。也可能切得更碎[我][喜][欢][A][I]—— 取决于分词器和词表。单位例子说明字符猫 是 1 个字符人眼的最小单元词喜欢 是 1 个词语言的最小语义单元字节汉字 UTF-8 占 3 字节计算机的存储单元Token喜欢 可能是 1 个 token模型的处理单元关键认知模型看不懂字、词、句子 —— 它只看得懂一串 token ID。你输入的每一句话都会被先切成 token、转成 ID才进入模型。所以Token 是 AI 世界的 字数 单位聊天、计费、限长、提速全部围着它转。二、为什么要分词为什么不能直接用 词 或 字模型只认数字神经网络的计算对象是向量而向量是从 词表vocabulary查出来的。所以第一步必须把文本映射成词表里的编号。那直接按 整词 分不行吗有三个致命问题词表爆炸英语有几百万个词形walk、walks、walking、walked……词表塞不下生僻词和新词Qwen2.5、ChatGPT 这种词表里没有直接整词切分就只能 不认识跨语言中文、英文、日文的 词 长得完全不一样一个词表很难统一。按 字符 分呢也不行 —— 英文单个字母几乎没有语义c-a-t 三个字母拆开谁也看不懂 猫而且序列太长、效率低。折中方案子词Subword—— 把词拆成 比词小、比字符大 的块高频词整体保留the、喜欢生僻词拆成已知子词unbelievable→unbelievable。这个 切块规则 就是分词器最主流的算法叫 BPE。三、BPE 到底怎么工作BPEByte Pair Encoding字节对编码分两步先 学 词表再用词表 切 文本。下面看完整机理图BPE 的机理分两个阶段训练阶段学词表把语料先拆到单字符然后反复统计 哪两个相邻单元出现次数最多把最高频的一对合并成一个新 token加入词表。重复成千上万次比如合并到词表有 5 万20 万个 token。编码阶段切文本用学到的词表对新文本做贪心最长匹配—— 从左到右尽量匹配最长的已知 token匹配不了就拆小。为什么这个设计很妙高频词the、喜欢、AI整体保留 → 序列短、效率高生僻词 / 新词拆成已知子词 → 永远不会 不认识这是模型能理解ChatGPT、豆包这类新词的底层原因词表大小可控 → 模型输出层的计算量可控输出层要给每个 token 打分。四、Token 的完整生命周期一个 token 从 字 到 向量 再到 生成的字要走完全程生命周期要点输入侧文字 → 分词 → token ID → 查表得向量 → 进 Transformer输出侧模型对词表里每个 token几万到几十万个打分 → Softmax 概率 → 采样选一个 → 反分词变成可读的字 → 拼回输入继续循环循环一次回答 成千上万次 选 token所以 token 越多回答越慢、越贵。五、中文用户特别关心的中英文 token 差异从上面的图能看到右侧面板英文一个词常拆成 1~3 个子词Hello World≈ 2~4 token中文一个汉字常占 1~2 token视分词器而定你好世界≈ 2~4 token同样语义的内容中文往往比英文消耗更多 token示意100 词英文 ≈ 130 token100 字中文 ≈ 160~220 token。为什么会这样英文单词由字母组成子词系统天然 兼容 拼写而汉字表意密度极高词表要容纳上万个常用字分词器要么 一字一 token占得多要么把常用双字词你好、喜欢合成一个 token省一些。不同模型的中文分词效率差异很大 —— 有的 1 字 1 token有的 1 字≈1.5~2 token。实际影响计费同样的对话中文版可能比英文版贵按 token 计费时窗口中文内容更快占满上下文窗口提示词设计中文提示词要更精简 —— 这也是提示词工程里 边界、精简 要求对中文用户更重要的原因。六、为什么 Token 对你这么重要三个实际价值计费几乎所有大模型 API 都按 token 计费输入 输出都算。示例一次 提问 200 token 回答 800 token 的调用 1000 token。省 token 就是省钱 ——把提示词写精简、把输出长度约束住都能直接省钱。窗口上下文窗口是 能装多少 token。128K token 大约能装 9 万多个英文单词、约 8~15 万汉字示意视分词器。超出就被截断 —— 所以长文档要 分块 RAG而不是硬塞。速度模型每秒只能生成有限个 token示意 20~100。长回答 等更久打字机效果 的每一 蹦就是一个 token。七、常见误区与细节新手必看1 token 1 个汉字 / 1 个英文单词—— 错。可能是 0.5 个字也可能是 2 个字空格、标点、大小写也占 token。示例英文 dont 常被拆成dont两个 token。数字常被拆123456可能被拆成123456视分词器这就是模型大数运算容易出错的原因之一。特殊 token 真实存在BOS开始、EOS结束、PAD补齐、UNK未知等是词表里的 系统角色不出现在人看的文本里。代码非常耗 token编程语言的符号密集{、;、-同样行数代码的 token 数远多于自然语言。多模态也讲 token图像被切成 patch 后每个 patch 是 视觉 token一张 1024×1024 图可能折算成上千 token音频用码本量化成 音频 token。多模态模型的计费和窗口同样按 token 算——图比字贵 就是这么来的。推理模型的 思考 也耗 token模型先输出一长串内部推理思维链再给答案 —— 这些思考内容同样计费、同样占时间。动手实验建议用在线 tokenizer 工具如 OpenAI 的 Tokenizer 页面、各模型官方工具实测同一句话的中英文 token 数立刻能体会 为什么中文更贵。一句话总结Token 是大模型处理语言的最小单位由分词器主要是 BPE从 字符 高频合并 中生成它贯穿输入编码、输出生成、计费、窗口、速度的全过程对中文用户而言中文更耗 token 直接关系到成本和体验 ——理解 token你就掌握了 AI 世界的 度量衡。
RELATED

相关推荐

AI Agent_9 AI 推理与规划(Reasoning  Planning)

AI Agent_9 AI 推理与规划(Reasoning Planning)

一、先区分两个概念推理(Reasoning):从已知推出未知 —— 理解、逻辑、数学、因果判断。示例:"如果明天下雨,出门就要带伞;天气预报说明天下雨,所以我要带伞。"(三段论&am…

📅 2026/10/5 2:23:41
5 分钟部署 Fast Note Sync Service:Docker 一键搭建 Obsidian 私有笔记同步服务器教程

5 分钟部署 Fast Note Sync Service:Docker 一键搭建 Obsidian 私有笔记同步服务器教程

5 分钟部署 Fast Note Sync Service:Docker 一键搭建 Obsidian 私有笔记同步服务器教程 【免费下载链接】fast-note-sync-service High-performance, low-latency note synchronization, online management, and remote REST API service platform. 项目地址: htt…

📅 2026/10/5 2:18:41
CLRS 3.2 标准记号与常用函数习题精解:对数、阶乘、多重对数与斐波那契数的渐近分析

CLRS 3.2 标准记号与常用函数习题精解:对数、阶乘、多重对数与斐波那契数的渐近分析

文档教程示例工程 【免费下载链接】CLRS :notebook:Solutions to Introduction to Algorithms 项目地址: https://gitcode.com/gh_mirrors/cl/CLRS 点击查看 免费下载 本文基于 CLRS(《算法导论》)习题解答仓库中的 C03-Growth-of-Functions…

📅 2026/10/5 2:18:41
MORE NEWS

更多资讯

📰

OpenCADStudio命令行与脚本自动化完整指南:如何用别名和命令脚本批量完成绘图任务

OpenCADStudio命令行与脚本自动化完整指南:如何用别名和命令脚本批量完成绘图任务 【免费下载链接】OpenCADStudio A CAD application built with Rust — 2D/3D drawing, DWG/DXF support, and GPU-accelerated rendering 项目地址: https://gitcode.com/gh_mirr…

📰

AI Agent 权限边界设计:从沙箱逃逸到最小权限实践

1. 从“AI Agent 逃出沙箱”说起:一个被低估的权限边界问题第一次看到“AI Agent 逃出沙箱”这个说法,我脑子里蹦出来的不是科幻电影里的天网,而是一个特别具体的画面:你给一个自动化脚本开了个容器,让它帮你整理文件、…

📰

上下文工程:AI Agent稳定落地的核心技术

1. 这不是“加长版Prompt”,而是AI Agent的呼吸系统你有没有试过给大模型喂一段超长的用户对话历史、三份PDF摘要、五条实时行情数据,再加一个“请综合判断是否下单”,结果模型要么直接截断、要么逻辑混乱、要么开始胡编乱造?这不…

📰

Roo Code 本地模型卡顿优化:从链路分析到参数配置的完整指南

如果你也试过在 Roo Code 里接本地模型,大概率会碰上这样一种体验:第一句话发出去,光标转圈转得人心慌;好不容易开始出字了,又是一个字一个字往外蹦,像在看慢镜头回放。说“卡顿”都算客气了,对…

📰

同一个Beacon为何只该计数一次:wifit3 WiFi审计工具wlan去重模块完全解析

同一个Beacon为何只该计数一次:wifit3 WiFi审计工具wlan去重模块完全解析 【免费下载链接】wifit3 Wifite but USB-only & cross-platform. 项目地址: https://gitcode.com/GitHub_Trending/wi/wifit3 wifit3 是一款跨平台(Linux / Windows /…

📰

RAG客服机器人实战:原理拆解与工程落地避坑指南

1. 为什么客服机器人总爱“一本正经地胡说八道”先说我自己的真实经历。之前团队做了一个客服机器人,接的是某产品的售后知识库,整理了几百篇 Word 和 PDF 文档,喂给大模型做微调。结果上线第一天就翻车了:用户问“保修期多久”&a…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬