AI Agent白手起家24: 本地大模型部署与LangChain接入实战 纲要闭源模型与开源本地模型的权衡硬件对推理速度的关键影响本地推理框架选择Ollama本地部署流程安装 Ollama拉取模型启动 API 服务LangChain 接入本地模型安装langchain-ollama使用ChatOllama进行同步与流式调用完整可运行代码示例闭源模型 vs 开源本地模型在 AI Agent 开发中选择模型时通常面临两条路径对比维度闭源模型GPT-4、Claude开源本地模型DeepSeek、Llama使用方式直接调用 API本地部署推理服务成本构成按 Token 计费硬件投入 运维成本数据隐私数据需传输至外部数据完全保留在本地硬件要求仅需网络连接需要较高 GPU 或大内存灵活性受限于 API 提供的能力可微调、量化、完全自主选用本地开源模型的典型场景包括数据安全合规要求、长期高频推理的成本控制、离线环境运行。但前提是拥有足够算力否则推理速度会成为瓶颈。硬件对推理速度的关键影响本地推理的性能主要由 GPU 显存和计算单元决定。以 Llama 系列模型为例不同硬件上的实测 Token 生成速度硬件7B 参数模型token/s65B 参数模型token/sApple M19.001.00Apple M228.573.08NVIDIA A100 (80GB)276.0029.77消费级设备M1/M2足以运行 7B 量化模型但大参数模型速度极慢。专业 GPU如 A100拥有充足显存推理速度有数量级优势适合生产环境。想要本地流畅运行 DeepSeek-R1 671B 等超大模型需多卡高端 GPU日常开发使用 7B~13B 量化版本即可。推理框架为什么选择 OllamaOllama 是当前最友好的本地推理框架之一具备以下特点一键安装命令行操作简单内置模型仓库覆盖 Llama、DeepSeek、Phi 等主流模型自动处理量化与 GPU 加速提供与 OpenAI 兼容的 REST API默认http://localhost:11434活跃的社区更新本地部署流程下面以部署 DeepSeek-R1 7B 为例演示完整步骤。安装 Ollama从 ollama.com 下载安装包。安装后在终端验证ollama--version拉取模型下载所需的模型文件ollama pull deepseek-r1:7b查看已安装模型ollama list# NAME ID SIZE MODIFIED# deepseek-r1:7b ... 4.7 GB ...启动 API 服务运行以下命令模型将以 API 形式在localhost:11434提供服务ollama serve使用curl快速测试curlhttp://localhost:11434/api/generate-d{ model: deepseek-r1:7b, prompt: 你好, stream: false }收到 JSON 响应即表示部署成功。LangChain 接入本地模型通过官方包langchain-ollama即可在代码中调用本地模型。安装依赖pipinstalllangchain-ollama同步调用fromlangchain_ollamaimportChatOllama llmChatOllama(modeldeepseek-r1:7b)responsellm.invoke(用一句话介绍什么是 AI Agent)print(response.content)流式输出forchunkinllm.stream(写一首关于春天的五言绝句):print(chunk.content,end,flushTrue)项目结构最小化项目如下├── main.py └── requirements.txtrequirements.txt内容langchain-ollama0.1.0完整可运行代码将以下代码保存为main.py确保 Ollama 服务运行且模型已下载。fromlangchain_ollamaimportChatOllama# 初始化本地 DeepSeek-R1 7B 模型llmChatOllama(modeldeepseek-r1:7b,temperature0.7,num_predict256,)print( 同步调用 )responsellm.invoke(请用一句话解释什么是强化学习)print(回答:,response.content)ifresponse.usage_metadata:print(Token 用量:,response.usage_metadata)print(\n 流式输出 )prompt请写一首关于秋天的七言绝句print(用户:,prompt)print(助手: ,end)forchunkinllm.stream(prompt):print(chunk.content,end,flushTrue)print()运行说明需提前安装langchain-ollama。确保ollama serve正在运行且已执行ollama pull deepseek-r1:7b。若电脑性能较弱可调小num_predict或改用更轻量的模型。关键要点本地开源模型适合隐私敏感、长期高频、离线环境但需投入硬件成本。Ollama 大幅降低了本地部署门槛推荐作为首选推理框架。通过ChatOllama接入 LangChain 后可与 API 模型保持一致的调用接口方便无缝切换。生产环境中建议将 Ollama 部署到独立的 GPU 服务器上供团队共享。