TextGen 本地大模型部署实战:从克隆到 API 调用的完整路线 TextGen 本地大模型部署实战从克隆到 API 调用的完整路线【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgenTextGen 是一个开源的本地大模型桌面应用与 Web UI支持文本、视觉、工具调用并提供 OpenAI/Anthropic 兼容的 API全程离线、无遥测。适合想在个人电脑或服务器上跑私有 LLM、又不想配置云服务环境的开发者与新手。下面按硬件选路线再给最短可跑通的部署步骤和调优参数。按硬件选部署路线你的环境推荐路线依赖文件对应章节NVIDIA GPUWindows/Linux一键脚本或 venv CUDA 版 llama.cpprequirements/full/requirements.txt或requirements/portable/requirements.txt最小可用部署AMD GPU一键脚本选 AMD 分支requirements/full/requirements_amd.txt最小可用部署无 GPU 的 x86 服务器venv CPU 依赖requirements/full/requirements_cpu_only.txt最小可用部署Apple Silicon / Intel Mac一键脚本或 venv MPS 依赖requirements/full/requirements_apple_silicon.txt最小可用部署容器化服务器Docker Composedocker/nvidia/、docker/cpu/等Docker 容器化部署依赖文件分requirements/full/含 Transformers、训练、绘图等完整后端和requirements/portable/仅 llama.cpp 后端体积更小两套按硬件后缀选择即可。最小可用部署venv 五步跑通以 Linux/macOS 为例Windows 把source venv/bin/activate换成venv\Scripts\activategit clone https://gitcode.com/GitHub_Trending/te/textgen cd textgen python -m venv venv source venv/bin/activate第 1 步成功标志本地出现textgen/目录。第 3 步成功标志出现venv/目录。安装依赖并启动pip install -r requirements/portable/requirements.txt --upgrade python server.py --portable --api --auto-launch安装成功标志终端无ERROR: Could not find a version that satisfies。启动成功标志浏览器自动打开http://127.0.0.1:7860出现 Chat/Default/Parameters 等标签页。放模型从 Hugging Face 下载任意 GGUF 文件放入user_data/models/界面会自动识别无需重启。Transformers 或 ExL3 等多文件模型需放在user_data/models/下的独立子文件夹中且必须用 full 版安装。不想手搭环境也可以直接跑 start_linux.sh或start_windows.bat、start_macos.sh脚本会自动装 Miniforge 环境按提示选 GPU 厂商装完同样访问http://127.0.0.1:7860。启动参数持久化写法两层配置作用域不同持久化配置——写入 user_data/CMD_FLAGS.txt每次启动server.py都会读取适合固定的网络与加载策略--listen绑定 0.0.0.0允许局域网访问--api启用 OpenAI/Anthropic 兼容 API默认端口 5000--model MODEL_NAME启动时直接加载指定模型--idle-timeout 60闲置 60 分钟后自动卸载模型释放显存--settings user_data/settings.yaml从 YAML 加载默认界面设置界面内即时配置——Parameters 标签页改动立即生效且随会话保存适合实验单个采样参数两者冲突时以启动参数为准。核心生成参数与推荐区间参数含义推荐区间max_new_tokens单次生成上限过高会挤占提示词截断空间512–2048temperature随机性主旋钮0 为确定性解码0.7–1.2top_p核采样阈值与 top_k 二选一即可0.9–1.0min_p相对最高概率的淘汰线替代 top_k 时更稳0.02–0.1repetition_penalty重复惩罚1 为关闭1.0–1.2截断长度防止提示词超出模型上下文模型 ctx − 512现成参数组合可直接用user_data/presets/下的 Creative.yamlmin_p 0.02 xtc 0.5、Deterministic.yaml、Top-P.yaml在 Preset 菜单中加载。进阶场景低显存量化加载显存紧张时换 Transformers 后端并降精度需 full 版依赖中的 bitsandbytes--load-in-4bit --use_double_quant4-bit 双重量化下8B 模型权重大约占 4.5–5GB 显存。配合--ctx-size 8192压低 KV cache--gpu-layers控制放卡上的层数llama.cpp 后端设-1为尽量全放。纯 CPU 机器用--cpu --threads 88 为物理核心数。局域网远程访问在user_data/CMD_FLAGS.txt追加--listen重启后从局域网用http://服务器IP:7860访问。多人共用加--multi-user不保存聊天记录。注意--listen会向同网段所有设备暴露 UI公共网络下请配合防火墙限制来源 IP。Docker 容器化部署以 NVIDIA 为例AMD/Intel/CPU 换成docker/amd、docker/intel、docker/cpuln -s docker/nvidia/{Dockerfile,docker-compose.yml,.dockerignore} . cp docker/.env.example .env mkdir -p user_data/logs user_data/cache docker compose up --build编辑本地.envTORCH_CUDA_ARCH_LIST按显卡填RTX 30 系 8.6、40 系 8.9APP_RUNTIME_GID填宿主机id -g的输出HOST_PORT默认 7860、API 端口HOST_API_PORT默认 5000。端口被占用时改.env里的HOST_PORT。完整说明见 docs/09 - Docker.md。故障自查现象可能原因处置动作加载模型报 CUDA out of memory量化精度或 ctx 过大换 4-bit GGUF或--ctx-size 8192、--gpu-layers减层pip install报依赖冲突系统 Python 装了冲突包用 venv/conda 隔离勿污染系统环境局域网打不开 7860未开--listen或防火墙拦截user_data/CMD_FLAGS.txt加--listen放行 7860/5000 端口启动卡住或后端报错requirements 选错硬件分支按硬件换回对应requirements_*.txt重装--upgrade模型列表为空模型没放对目录GGUF 放user_data/models/根下多文件模型放子文件夹API 调不通未加--api或端口不符确认--api已启用请求指向http://127.0.0.1:5000下一步用 docs/03 - Parameters Tab.md 逐条对照采样参数把 Parameters 页的 top_k、tfs、penalty 系列各跑一轮对比输出差异。阅读 docs/07 - Extensions.md把 TTS、语音输入、机器翻译扩展放进user_data/extensions/试装。参考user_data/tools/下的 web_search.py 写一个自己的工具函数验证工具调用链路。【免费下载链接】textgenOpen-source desktop app for local LLMs. Text, vision, tool-calling, OpenAI/Anthropic-compatible API. 100% private.项目地址: https://gitcode.com/GitHub_Trending/te/textgen创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考