
1. 项目概述最近在折腾用AMD显卡跑本地大模型发现6750GRE这张10G显存的卡性价比相当不错。Ollama作为目前最流行的本地大模型运行框架官方对AMD显卡的支持还不太完善需要手动配置才能发挥显卡性能。下面记录下我的完整配置过程包括从环境准备到模型运行的每个细节。这个方案特别适合预算有限但又想体验本地大模型的朋友。相比动辄上万的N卡6750GRE只要两千多就能拿下10G显存跑7B模型完全够用。实测Qwen-7B的推理速度能达到15token/s左右日常对话完全够用。2. 环境准备2.1 硬件配置要求我的测试平台配置如下CPUAMD Ryzen 7 5800X显卡AMD Radeon RX 6750 GRE 10G内存32GB DDR4 3600MHz系统Windows 11 22H2重点说下显卡选择。6750GRE有10G和12G两个版本建议选10G版因为价格更便宜差价约300元10G显存对7B模型已经足够12G版性能提升有限性价比不高2.2 软件依赖安装首先需要安装以下必备组件AMD显卡驱动建议使用最新版Adrenalin 23.12.1ROCm 5.7.1AMD的AI计算平台Visual Studio 2022需要C开发组件安装ROCm时有个坑要注意官方默认不支持Windows需要下载社区维护的版本。我用的这个 https://github.com/RadeonOpenCompute/ROCm/releases/tag/rocm-5.7.13. Ollama安装与配置3.1 基础安装从官网下载Ollama Windows版curl -L https://ollama.com/download/OllamaSetup.exe -o OllamaSetup.exe安装完成后默认路径是C:\Users\用户名\AppData\Local\Programs\Ollama3.2 AMD适配修改关键步骤来了要让Ollama支持AMD显卡需要替换几个关键文件下载适配文件包curl -L https://github.com/likelovewant/ollama-for-amd/releases/download/v0.16.1/ollama-windows-amd64.7z -o ollama-amd.7z解压后替换以下文件ollama.dlllib\ollama\rocm\*lib\ollama\llama.dll特别重要的rocblas库替换curl -L https://github.com/likelovewant/ROCmLibs-for-gfx1103-AMD780M-APU/releases/download/v1.0/rocm.gfx1031.for.hip.6.4.2.7z -o rocm-libs.7z解压后替换rocblas目录下的所有文件。注意替换前建议备份原文件以防出现问题可以快速恢复。4. 模型部署与优化4.1 模型下载技巧Ollama支持的主流模型都可以在官网找到 https://ollama.com/library国内下载慢的解决方法使用代理不展开分段下载发现速度变慢时CtrlC中断重新开始会继续社区镜像有些技术论坛会分享百度网盘链接我测试的Qwen-7B模型下载命令ollama pull qwen:7b4.2 性能调优参数在~/.ollama/config.json中添加以下配置{ num_gpu_layers: 35, main_gpu: 0, tensor_split: 10, threads: 8 }参数说明num_gpu_layersGPU加速的层数35适合7B模型main_gpu指定主显卡tensor_split显存分配10表示全部给显卡threadsCPU线程数建议设为物理核心数5. 实测性能与问题排查5.1 基准测试结果使用Qwen-7B模型的测试数据首次加载时间约45秒平均推理速度12-18 token/s显存占用稳定在9.2GB左右温度控制GPU核心温度75℃左右5.2 常见问题解决报错ROCm not found解决方法检查ROCm环境变量是否设置确认替换了所有必要的dll文件模型加载失败可能原因文件下载不完整显存不足推理速度慢优化建议降低num_gpu_layers值关闭其他占用GPU的程序6. 进阶使用技巧6.1 多模型管理查看已下载模型ollama list删除不需要的模型ollama rm 模型名6.2 API调用示例启动API服务ollama servePython调用示例import requests response requests.post( http://localhost:11434/api/generate, json{ model: qwen:7b, prompt: 你好介绍一下你自己, stream: False } ) print(response.json())6.3 内存优化方案如果遇到内存不足使用4bit量化模型ollama pull qwen:7b-q4_0调整num_gpu_layers减少GPU层数增加虚拟内存至少32GB7. 使用体验与建议这套配置我稳定运行了两周总结几点心得性价比确实高N卡同性能至少贵3倍社区支持越来越好新驱动对ROCm的优化明显7B模型日常使用完全够用写代码、翻译、问答都不错如果想更流畅体验加装SSD模型加载速度提升明显内存升级到64GB可以跑更大模型保持驱动更新每月检查一次最后提醒下首次运行建议监控显存和温度确保散热没问题。我用的机箱是乔思伯D31加装了三个进风风扇温度控制在合理范围。