10 分钟跑通 LocalAI:本地部署私有 AI 推理服务的完整指南 10 分钟跑通 LocalAI本地部署私有 AI 推理服务的完整指南【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAILocalAI 是一个开源的本地 AI 推理服务对外讲 OpenAI 与 Anthropic 的 API 协议在 CPU 或 GPU 硬件上运行文本、图像、音频、视频等多模态模型。它适合两类人想在自己的机器上跑模型、不愿把数据发去云端的开发者以及已有基于 OpenAI API 写成的应用、希望把 base_url 换成本地地址的用户。10 分钟跑通 LocalAI 本地部署先跑起来再谈原理。有 Docker或 Podman的话下面这条命令会拉取镜像并在 8080 端口启动服务docker run -ti --name local-ai -p 8080:8080 localai/localai:latest这条镜像是 CPU 版本不带预配置模型但已经包含了全部后端能力——缺什么模型装什么后文会解释它是怎么做到轻量的。浏览器打开http://localhost:8080就能看到内置 WebUI与模型对话、在 Models 页面安装和管理模型、配置 Agent、查看资源占用都不需要额外装任何工具。装第一个模型有两条路。WebUI 里打开 Models → Explore搜到一个模型点 Install 即可命令行则直接在启动时带上模型名服务会在 API 就绪前自动下载安装local-ai run llama-3.2-1b-instruct:q4_k_m这里选llama-3.2-1b-instruct的q4_k_m量化版本文件只有 1-3 GB 量级纯 CPU 也能动。装好后打开 Chat 页面选它发消息几秒内就能收到回复也可以用 API 验证服务是否就绪curl http://localhost:8080/v1/chat/completions -H Content-Type: application/json \ -d {model: llama-3.2-1b-instruct, messages: [{role: user, content: Hello!}]}这个端点与 OpenAI 的/v1/chat/completions完全同构任何 OpenAI SDK 改一下 base_url 就能接上Anthropic Messages API 和 Open Responses API 同样可用。最后提醒一句安全配置服务如果要暴露到局域网以外用环境变量LOCALAI_API_KEYyour-key给接口加一道密钥或设置LOCALAI_AUTHtrue开启多用户认证角色、OAuth 登录、使用量跟踪。遇到启动异常时设置DEBUGtrue可以看到更多日志。硬件与后端架构需要哪些资源没有 GPU 能否运行模型占多少空间能。GPU 是可选的加速器而非前提官方明确标注 No GPU required。容量上1-3B 参数的模型大约占 1-3 GB7-13B 约 4-8 GB30B 以上要 15-30 GBFAQ 建议预留模型体积 2-3 倍的空间给下载和临时文件用 SSD 效果更好。模型比内存还大时运行效率会明显下降选型时先看看自己的 RAM。有 GPU 时按硬件选镜像即可NVIDIA 用localai/localai:latest-gpu-nvidia-cuda-12CUDA 13 有对应 tag并加--gpus allAMD ROCm 用latest-gpu-hipblasIntel 用latest-gpu-intelVulkan 用latest-gpu-vulkan另有 Jetson 的 L4T 镜像。启动时 LocalAI 会自动探测 GPU 能力并下载匹配的后端多数场景不用手工配置。后端按需拉取核心只有一个LocalAI 是小核心、不打包的设计核心进程只提供 OpenAI 兼容 API、请求路由、WebUI 和 Agent每个推理引擎llama.cpp、vLLM、whisper.cpp、stable-diffusion、MLX 等都是一个独立的 OCI 镜像只有当某个模型需要它时才被拉下来。跑一个 1B 对话模型就不会下载图像生成的引擎。目前内置了 60 多个后端全部通过同一套 gRPC 接口与核心通信。这意味着任何兼容模型都可以加载也可以用任意语言写一个自己的后端接入——接口是开放的核心没有封闭。模型来源不止画廊一处可以从 HuggingFace 直接拉 GGUFlocal-ai run huggingface://...、从 Ollama 注册表取ollama://gemma:2b、用一份 YAML 配置定义或指向任意 OCI 注册表。下载位置默认是命令行下的./models、容器内/models、macOS 应用~/.localai/models用LOCALAI_MODELS_PATH环境变量可以改到别的盘。核心功能文本、视觉、语音、检索与多模态文本生成由 llama.cpp、vLLM、SGLang、transformers 等后端驱动支持 OpenAI 兼容的工具调用 API 和约束语法限制模型只能按你给的格式输出 JSON 之类的结构。视觉和音频方向覆盖得比较宽Vision API 支持图片输入对象检测、开放词汇检测locate-anything.cpp、人脸检测与识别、深度估计各有对应后端音频侧有 whisper.cpp 系列的语音转文字、Piper 等后端做文字转语音、说话人分离diarization、语音活动检测Silero-VAD还有实时 Realtime API 支持语音到语音、通过 WebRTC 通话。多模态与检索补齐了剩下的拼图stable-diffusion-ggml 等后端做图像生成LTX-2 和 wan-ggml 做视频生成嵌入embeddings生成与重排序rerankerAPI 可直接接 RAG 管道项目还自带 local-store 这个本地向量数据库。终端里有local-ai chat内置 Agent能读文件、执行命令改状态的操作会先征求你的同意。多用户、Agent 与分布式推理场景单台机器用完后有几条横向扩展的路。多用户层面支持 API key、OIDC 登录、管理员/用户角色、按 API key 和按用户的使用量配额适合在团队内网里共用一个实例。Agent 是内置平台而非外挂支持工具使用、RAG、技能skills和 MCPModel Context Protocol一种让模型调用外部工具的标准协议在 WebUI 里创建 Agent 时配上工具和系统提示词对话时它会自主调用工具。算力不够时再上分布式模式GPU 工作节点向协调器自注册请求按 VRAM 感知路由并自动扩缩P2P 联邦可以把多台 LocalAI 实例连起来做负载均衡大模型还能跨机分片。这套模式依赖 PostgreSQL 与 NATS 做状态和消息属于进阶部署官方文档在 docs/content/features/distributed-mode.md。文档入口与下一步仓库自带完整文档按主题组织安装与快速上手 覆盖容器、macOS、Linux、Kubernetes 等路径features 目录 按模态逐一介绍每种能力FAQ 集中回答是否要装全部后端模型存哪里这类高频问题。代码层面backend/ 下每个子目录对应一个推理引擎的封装llama-cpp、whisper、vllm-cpp、kokoros 等gallery/ 是可一键安装的模型清单配置core/ 是核心服务本身。建议的下一步先用 CPU 镜像把服务拉起来装一个 Q4 量化的 1-3B 模型完成对话然后把现有 OpenAI 客户端的 base_url 指到http://localhost:8080/v1验证兼容性——这三步走完你就有了一个可以接进现有工作流的本地推理端点。【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考