取算存——模型容量、能耗指标和架构梳理 AI模型的计算过程可系统性地拆解为“取”、“算”、“存”三大阶段每个阶段又可细化为多个子步骤并对应着关键的容量、架构、能耗指标。1. “取”阶段数据与指令获取此阶段负责将模型权重、输入数据及计算指令从存储系统加载至计算单元。子步骤关键容量指标架构能耗指标1.1 指令取指 (Instruction Fetch)指令缓存容量 (I-Cache Size)决定能预取和缓存的指令数量。分支目标缓冲区大小 (BTB Size)影响分支预测的准确性和覆盖范围。多级指令缓存架构、分支预测器设计如TAGE、Perceptron、指令预取单元Stream Buffer、Stride Prefetcher指令缓存访问能耗、分支预测器功耗、预取单元动态功耗1.2 数据加载 (Data Load)缓存层级容量 (Cache Hierarchy Capacity)L1/L2/L3 Cache、共享LLC的大小。KV Cache容量在自回归生成中决定能缓存的上下文长度。内存带宽 (Memory Bandwidth)决定数据从主存加载到缓存的峰值速率。非统一内存访问NUMA架构、缓存一致性协议MESI、MOESI、HBM/GDDR内存子系统、KV Cache专用硬件加速缓存访问能耗按层级、内存控制器功耗、DRAM/PIM存内处理能耗、数据传输能耗1.3 权重预取与广播 (Weight Prefetching Broadcasting)网络带宽 (Network Bandwidth)节点间数据传输的峰值速率。参数服务器存储容量能容纳的模型参数总量。预取缓冲区大小 (Prefetch Buffer Size)决定能提前加载多少未来需要的数据块。参数服务器架构、All-Reduce通信拓扑Ring、Tree、RDMA网络、权重预取流水线、广播总线设计网络接口卡NIC功耗、交换机能耗、参数服务器存储能耗、预取逻辑动态功耗2. “算”阶段核心计算执行此阶段在算术逻辑单元ALU、张量核心Tensor Core等计算单元上执行矩阵乘、卷积等核心运算。子步骤关键容量指标架构能耗指标2.1 指令译码与发射 (Instruction Decode Issue)重排序缓冲区大小 (ROB Size)决定能同时跟踪的未完成指令数量。保留站容量 (Reservation Station Entries)影响指令发射的并行度。发射宽度 (Issue Width)每个周期能发射的指令数。超标量/超长指令字VLIW架构、乱序执行引擎、多发射流水线、SIMD/SIMT指令集扩展译码器功耗、重排序缓冲区访问能耗、指令发射队列动态功耗、寄存器重命名功耗2.2 计算执行 (Execution)峰值算力 (Peak FLOPS/TFLOPS)硬件理论最大计算吞吐量。寄存器文件容量 (Register File Size)决定能同时驻留在计算单元附近的数据量。张量核心数量/规模决定并行矩阵乘法的能力。多核/众核架构、张量处理单元TPU设计、脉动阵列、存算一体PIM/CIM架构、近似计算单元计算单元动态功耗与频率/电压相关、寄存器文件访问能耗、张量核心能效比FLOPS/Watt、热设计功耗TDP2.3 同步与归约 (Synchronization Reduction)聚合带宽 (Aggregate Bandwidth)集群内所有节点间同时通信的总带宽。归约缓冲区大小 (Reduction Buffer Size)决定单次能归约的数据量。同步原语支持的最大进程/线程数。硬件屏障同步单元、原子操作加速器、归约树网络拓扑、全局同步控制器同步逻辑功耗、归约网络能耗、原子操作加速器动态功耗、全局时钟网络功耗3. “存”阶段结果写回与更新此阶段将计算结果写回内存或缓存并可能更新模型状态。子步骤关键容量指标架构能耗指标3.1 结果写回 (Write-Back)写缓冲区深度 (Write Buffer Depth)决定能缓冲的待写回结果数量。存储队列容量 (Store Queue Size)影响乱序执行中存储指令的缓冲能力。回写带宽 (Write-back Bandwidth)数据从计算单元写回缓存的速率。写合并缓冲区架构、非阻塞写回流水线、缓存替换策略硬件LRU、Random、写分配/非写分配策略写缓冲区访问能耗、缓存行写回功耗、存储队列维护功耗、写分配逻辑动态功耗3.2缓存一致性维护 (Cache Coherence Maintenance)目录/监听过滤器容量 (Directory/Snoop Filter Capacity)跟踪缓存行状态的数据结构大小。一致性域最大节点数协议能支持的最大处理器/GPU核心数。无效化队列深度 (Invalidation Queue Depth)。目录一致性协议、监听式一致性协议、基于Token的一致性、硬件一致性控制器、分布式目录结构一致性协议消息处理功耗、目录访问能耗、无效化广播能耗、一致性控制器静态功耗3.3模型状态更新 (Model State Update)模型参数总量 (Parameter Count)决定需要存储和更新的数据规模。优化器状态内存占用如Adam的动量和方差。持久化存储带宽/容量用于Checkpointing的磁盘/NVMe性能。参数服务器架构、梯度聚合拓扑、异步/同步更新策略、检查点压缩硬件、非易失内存NVM存储层次参数更新通信能耗、优化器状态访问功耗、检查点写入能耗、NVM编程功耗3.4 输出返回 (Output Return)输出缓冲区大小 (Output Buffer Size)决定能缓存的生成结果长度。PCIe/NVLink带宽设备到主机数据传输速率。服务端并发请求处理容量QPS每秒查询数。DMA引擎设计、主机-设备通信协议、输出流水线架构、请求调度器、负载均衡硬件DMA传输功耗、PCIe/NVLink链路能耗、输出缓冲区访问功耗、请求调度器动态功耗。参考来源延迟指标解析缓存命中率、流水线停顿与分支预测5大关键指标如何评估AI算力网络的通信性能算力≠速度TOPS、GFLOPS、带宽、延迟这些指标怎么读AI硬件的未来发展方向——存算融合AI算力网络中低延迟通信协议的实现原理与代码示例AI算力网络中的算力模型安全验证方法