尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Spirula Studio 的 Radix Sort 与 Prefix Scan:跨厂商 GPU 排序原语完全指南
Spirula Studio 的 Radix Sort 与 Prefix Scan跨厂商 GPU 排序原语完全指南【免费下载链接】spirula-studioCross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA.项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studioSpirula Studio 是一款跨厂商的 3D 高斯泼溅3D Gaussian Splatting训练工具能从视频一路训练到 splat 再到网格同时支持 Vulkan 与 CUDA 两种后端。而让它在 NVIDIA、AMD、Intel、Apple 显卡上跑同一套训练逻辑的关键底座之一就是本文的主角——一套跨厂商的radix sort基数排序与prefix scan前缀扫描排序原语。这篇指南会用尽量通俗的方式讲清楚它们是干什么的、怎么设计的、为什么难。为什么排序原语对 3DGS 训练这么重要3D 高斯泼溅的训练和渲染几乎每一步都绕不开排序和求前缀和原语在 Spirula Studio 中的典型用途sort_pairs键值对排序把每个 tile屏幕小块里的高斯按深度排序再按序做透明度合成inclusive_sum/exclusive_sum前缀和统计 tile 内高斯数量、生成偏移表densify 阶段 MCMC 采样的累积和select_flagged流压缩根据标志位把存活的元素紧凑地拷到一起简单说GPU 上百万级的高斯要高效地按位置、按深度组织起来排序就是最基础的那把锤子。而问题在于——NVIDIA 的 CUDA 生态有成熟的 CUB 库可以直接用但 Vulkan 是跨厂商的开放接口没有现成的设备端排序库可用。一个接口两种实现后端接缝设计Spirula Studio 的做法很优雅在 src/backend/common/SortScan.h 里只声明一套接口然后在两个后端里各写一份实现Engine 训练代码 │ ▼ backend::sort_pairs / inclusive_sum / select_flagged ← 唯一接口 ├─ CUDA 后端 → 薄封装 CUBRadixSort / DeviceScan / DeviceSelect └─ Vulkan 后端 → 自己用 Slang 写的 radix sort 前缀扫描计算核CUDA 实现见 src/backend/cuda/SortScanCuda.cu本质是把 CUB 的调用包一层保证行为与原来完全一致Vulkan 实现见 src/backend/vulkan/SortScanVulkan.cpp主机侧调度和 src/backend/vulkan/shaders/sort_scan.slangGPU 侧计算核。这样一来上层训练代码只需要知道我要排序不需要知道底下是 CUB 还是 Slang——这就是所谓的后端接缝整体架构在 src/backend/README.md 和 docs/backends.md 中有更完整的描述。Radix Sort 三趟法直方图、脊柱扫描、排名散列Vulkan 端的 radix sort 是经典的低位优先LSD三趟流水线每趟处理 8 个比特直方图Histogram把数据切成 2048 个一组的分区每个工作区workgroup统计自己分区里 0~255 每个数字出现多少次脊柱扫描Spine Scan对各分区计数做前缀和算出每个数字的全局起始位置——这一步本身就是 prefix scan两个原语在这里相遇了排名并散列Rank and Scatter每个线程用 subgroup ballot 投票算出自己这个元素在同数字里的稳定排名然后把它写到输出缓冲的正确位置。几个值得新手记住的设计点begin_bit/end_bit参数如果键值的高位全是 0比如只用低位存 tile 编号 深度可以直接跳过不需要的趟数省掉无谓的排序开销64 位键是刻意决策tile 键的结构是(tile_id 32) | depth32 位打包在大型实景数据集上会溢出所以 Vulkan 端专门编译了 64 位键的变体ping-pong 双缓冲排序结果在两块缓冲区之间来回倒腾DoubleBuffer和 CUB 的行为完全对齐上层代码无感知。Prefix Scan 两级扫描块内 全局前缀和实现用的是标准的两级工作区扫描sort_scan.slang 中的scan_blocks/scan_spine/scan_add每个 256 线程的工作区负责 2048 个元素先做块内扫描顺手记下整块的总和再对所有块总和做一次脊柱扫描得到每个块的起始偏移最后把偏移加回块内结果完成全局前缀和。支持的类型包括int32、int64以及一个特别的float版包含式前缀和——它服务于 densify 阶段 MCMC 采样的累积概率计算。文档里也诚实地标注了浮点求和的结合顺序和 CUB 不同跨后端的结果只保证在舍入误差内一致这是数值计算的正常现象。select_flagged流压缩则是前缀和 散列 计数回读的组合拳先对标志位做排他前缀和得到每个存活元素的目标位置再一次性散列过去最后回读一个数告诉调用方选出了多少。跨厂商的隐形深坑这些细节才真正值钱在单一 GPU 上写排序不难难的是在每一家厂商的驱动上都对。Spirula Studio 的 Vulkan 实现处理了不少硬骨头详见 src/backend/vulkan/README.md 的 Sort / scan 一节不假设 subgroup 宽度NVIDIA 是 32 线程一组AMD 是 64Intel 甚至可变。所有 ballot 排名代码用uint4掩码写成宽度无关的形式主机侧还会主动钉住 subgroup 尺寸——Intel 驱动上不定尺寸排序会静默产出错误结果没有 64 位整数特性就自己模拟部分老设备不支持shaderInt64实现里用uint2字对模拟 64 位键与扫描累加器内存布局与原生版本一致同一套入口名通吃共享内存 bank 冲突排序散列阶段的排名暂存区一开始让 32 条 lane 挤在同两个 bank 上转置布局后直接收回了整个分箱阶段 12% 的时间。这些经验大多被写进了官方文档是踩坑记录级别的干货。怎么验证和 CPU 参考实现逐条对答案排序原语的正确性由 src/backend/vulkan/tests/vk_sortscan_test.cpp 把关。它的思路非常朴实——用 CPU 当裁判生成随机键值对用std::stable_sort算出参考顺序逐位比对 GPU 结果顺带验证了稳定性覆盖 32/64 位键、非 8 倍数的比特区间、重复键洪泛、空输入、以及超过 65535 网格折叠上限的超大尺寸等边界扫描与流压缩同样与 CPU 前缀和逐元素比对。测试在 NVIDIA 私有驱动、Mesa ANVIntel 开源驱动、llvmpipe软件渲染上全部跑通且验证层零警告——这正是跨厂商三个字最硬核的注脚 ✅延伸阅读与代码导航想读什么去哪里排序/扫描/压缩的统一接口src/backend/common/SortScan.hCUDA 端CUB 封装实现src/backend/cuda/SortScanCuda.cuVulkan 端主机侧调度src/backend/vulkan/SortScanVulkan.cppVulkan 端 GPU 计算核Slangsrc/backend/vulkan/shaders/sort_scan.slang正确性测试src/backend/vulkan/tests/vk_sortscan_test.cpp后端架构总览docs/backends.md移植风险与性能笔记src/backend/README.md小结Spirula Studio 的 radix sort 与 prefix scan 是一组教科书级的跨厂商 GPU 原语设计范例一套接口、两种实现、CPU 对答案、坑全部写进文档。它把 CUB 在 CUDA 生态中的地位用 Slang 计算核在 Vulkan 生态里重新搭了出来为上层的高斯泼溅训练换上了真正与厂商无关的双腿。如果你想给任何开源 GPU 项目添加跨厂商排序能力这套模式——接口先行、双后端实现、奇偶校验测试——都非常值得直接借鉴 【免费下载链接】spirula-studioCross-vendor 3D Gaussian Splatting trainer - video to splat to mesh, Vulkan or CUDA.项目地址: https://gitcode.com/GitHub_Trending/sp/spirula-studio创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

AI工程从零构建:手写管道而非套用MLOps平台

AI工程从零构建:手写管道而非套用MLOps平台

1. 这不是“搭积木”,而是亲手锻造AI系统的完整工程链“AI Engineering from Scratch”——看到这个标题,很多人第一反应是:又要学Python、调PyTorch、跑通一个ResNet?不。它根本不是“从零写模型”,而是从一张白纸开始…

📅 2026/9/30 12:38:02
项目采购管理避坑指南:从自制外购到合同管理实操

项目采购管理避坑指南:从自制外购到合同管理实操

1. 为什么项目一做大,采购就变成“背锅侠”以前我在一个小团队做项目的时候,采购这事儿基本就是“谁缺谁买、买完报销”,根本没人把它当回事。后来有一次负责一个跨部门的实施类项目,预算几百万,涉及硬件、软件授权、外…

📅 2026/9/30 12:38:02
TensorFlow生产级落地:架构原理、安装避坑与SavedModel交付

TensorFlow生产级落地:架构原理、安装避坑与SavedModel交付

1. 这不是“装个库”那么简单:TensorFlow到底在解决什么问题? 你搜“tensorflow安装”,点开前十个结果,八成是 pip install tensorflow 然后报错截图——ImportError: DLL load failed、No module named ‘tensorflow.python’、C…

📅 2026/9/30 12:33:00
MORE NEWS

更多资讯

📰

把伊娃搬到桌面上,稚晖君开源机器人

由稚晖君开源的 ElectronBot。它不只是桌面摆件,而是一台能动的电脑配件。ElectronBot 是一款桌面级小机器人,外观设计的灵感来源是《机器人总动员》WALL-E 里面的伊娃。它通过 USB 直连电脑,把圆形屏幕、USB 摄像头、六轴舵机、AI 识别全部塞…

📰

Windows Hello指纹驱动开发实战:UMDF2+WinUSB避坑指南

简介:本资源是微软官方发布的《Windows Hello生物识别驱动设计指南》PDF文档,面向Windows驱动开发工程师、安全认证系统开发者及嵌入式生物识别设备厂商技术人员,系统解决WBDI(Windows Biometric Driver Interface)驱动…

📰

DX12 PBR渲染实战:从光照模型到IBL的完整实现与调参指南

1. 从光照模型到PBR:为什么DX12项目绕不开这一步 很多人在DX12里跑通第一个三角形、把纹理贴上去之后,下一步就卡住了——画面看起来“能跑”,但就是不对劲。金属像塑料,塑料像纸片,光照要么死白要么死黑。这不是DX12的…

📰

Node-Red 本地物联网中枢:可视化编程与 MQTT 数据流实战

1. 为什么我最终选了 Node-Red 做本地物联网中枢搞物联网项目的人大概都有过这种纠结:传感器数据上来了,想做个联动逻辑,写代码吧,改一行就得重新烧录或者重启服务;用现成的平台吧,又担心数据不在自己手里&…

📰

深信服HCI题库:超融合工程师的隐性知识验证指南

简介:本资源是面向深信服HCI(超融合基础设施)认证备考人员与IT运维工程师的专项题库资料,聚焦超融合架构原理、aSAN分布式存储、虚拟网络(VXLAN/业务网/管理网)、虚拟机优化、安全微隔离及FC/NFS存储对接等…

📰

开源版Jev登顶Hugging Face:编程Agent本地部署与Codex接入全指南

最近这两天,开发者群里讨论最多的消息之一,就是“「开源版Jev」登上 Hugging Face 热榜第一”。如果你也在刷 Hugging Face 的 Trending 榜,应该看到了那个模型卡:名字里带着 Jev,定位是面向编程场景的 Agent 类型模型…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬