尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
AI Agent白手起家24: 本地大模型部署与LangChain接入实战
纲要闭源模型与开源本地模型的权衡硬件对推理速度的关键影响本地推理框架选择Ollama本地部署流程安装 Ollama拉取模型启动 API 服务LangChain 接入本地模型安装langchain-ollama使用ChatOllama进行同步与流式调用完整可运行代码示例闭源模型 vs 开源本地模型在 AI Agent 开发中选择模型时通常面临两条路径对比维度闭源模型GPT-4、Claude开源本地模型DeepSeek、Llama使用方式直接调用 API本地部署推理服务成本构成按 Token 计费硬件投入 运维成本数据隐私数据需传输至外部数据完全保留在本地硬件要求仅需网络连接需要较高 GPU 或大内存灵活性受限于 API 提供的能力可微调、量化、完全自主选用本地开源模型的典型场景包括数据安全合规要求、长期高频推理的成本控制、离线环境运行。但前提是拥有足够算力否则推理速度会成为瓶颈。硬件对推理速度的关键影响本地推理的性能主要由 GPU 显存和计算单元决定。以 Llama 系列模型为例不同硬件上的实测 Token 生成速度硬件7B 参数模型token/s65B 参数模型token/sApple M19.001.00Apple M228.573.08NVIDIA A100 (80GB)276.0029.77消费级设备M1/M2足以运行 7B 量化模型但大参数模型速度极慢。专业 GPU如 A100拥有充足显存推理速度有数量级优势适合生产环境。想要本地流畅运行 DeepSeek-R1 671B 等超大模型需多卡高端 GPU日常开发使用 7B~13B 量化版本即可。推理框架为什么选择 OllamaOllama 是当前最友好的本地推理框架之一具备以下特点一键安装命令行操作简单内置模型仓库覆盖 Llama、DeepSeek、Phi 等主流模型自动处理量化与 GPU 加速提供与 OpenAI 兼容的 REST API默认http://localhost:11434活跃的社区更新本地部署流程下面以部署 DeepSeek-R1 7B 为例演示完整步骤。安装 Ollama从 ollama.com 下载安装包。安装后在终端验证ollama--version拉取模型下载所需的模型文件ollama pull deepseek-r1:7b查看已安装模型ollama list# NAME ID SIZE MODIFIED# deepseek-r1:7b ... 4.7 GB ...启动 API 服务运行以下命令模型将以 API 形式在localhost:11434提供服务ollama serve使用curl快速测试curlhttp://localhost:11434/api/generate-d{ model: deepseek-r1:7b, prompt: 你好, stream: false }收到 JSON 响应即表示部署成功。LangChain 接入本地模型通过官方包langchain-ollama即可在代码中调用本地模型。安装依赖pipinstalllangchain-ollama同步调用fromlangchain_ollamaimportChatOllama llmChatOllama(modeldeepseek-r1:7b)responsellm.invoke(用一句话介绍什么是 AI Agent)print(response.content)流式输出forchunkinllm.stream(写一首关于春天的五言绝句):print(chunk.content,end,flushTrue)项目结构最小化项目如下├── main.py └── requirements.txtrequirements.txt内容langchain-ollama0.1.0完整可运行代码将以下代码保存为main.py确保 Ollama 服务运行且模型已下载。fromlangchain_ollamaimportChatOllama# 初始化本地 DeepSeek-R1 7B 模型llmChatOllama(modeldeepseek-r1:7b,temperature0.7,num_predict256,)print( 同步调用 )responsellm.invoke(请用一句话解释什么是强化学习)print(回答:,response.content)ifresponse.usage_metadata:print(Token 用量:,response.usage_metadata)print(\n 流式输出 )prompt请写一首关于秋天的七言绝句print(用户:,prompt)print(助手: ,end)forchunkinllm.stream(prompt):print(chunk.content,end,flushTrue)print()运行说明需提前安装langchain-ollama。确保ollama serve正在运行且已执行ollama pull deepseek-r1:7b。若电脑性能较弱可调小num_predict或改用更轻量的模型。关键要点本地开源模型适合隐私敏感、长期高频、离线环境但需投入硬件成本。Ollama 大幅降低了本地部署门槛推荐作为首选推理框架。通过ChatOllama接入 LangChain 后可与 API 模型保持一致的调用接口方便无缝切换。生产环境中建议将 Ollama 部署到独立的 GPU 服务器上供团队共享。
RELATED

相关推荐

AI Agent白手起家23: 大模型速率限制应对与缓存机制实践

AI Agent白手起家23: 大模型速率限制应对与缓存机制实践

纲要 速率限制的产生背景与影响LangChain 内置速率限制器 InMemoryRateLimiter 核心参数 缓存机制的必要性与原理 短期缓存(内存)与长期缓存(持久化) 实战:速率限制与缓存结合 项目结构速率限制器配置缓存方案对比&…

📅 2026/9/9 0:57:57
AI Agent白手起家22: 理解大模型上下文窗口与Token管理实战

AI Agent白手起家22: 理解大模型上下文窗口与Token管理实战

纲要 上下文窗口是什么Token 的本质与计算方式上下文窗口的限制因素 Transformer 注意力机制的复杂度硬件显存与响应时间训练数据的短文本倾向注意力衰减与长距离依赖 应对上下文窗口限制的策略 检索增强生成滑动窗口新架构探索 LangChain 中的 Token 追踪 usage_metadata 与 r…

📅 2026/8/24 17:46:13
Excel集合归属判断:从COUNTIF到XMATCH的高效解决方案

Excel集合归属判断:从COUNTIF到XMATCH的高效解决方案

1. 从“找茬”到“归类”:一个高频但易错的Excel需求做数据分析或者日常处理表格,我们经常会遇到一个看似简单,实则暗藏玄机的问题:怎么快速判断表格里某个单元格的内容,是不是属于我预先准备好的一个“名单”里&#…

📅 2026/9/21 8:06:07
MORE NEWS

更多资讯

📰

STM32软件SPI驱动1.8寸TFT-LCD完整教程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

PCIe 5.0交换芯片如何破解AI集群GPU互联瓶颈

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

2026跨部门协同研发管理系统选型指南:避开踩坑实战解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

📰

Voyager 資料夾管理指南:為 Gemini 與 AI Studio 的 AI 對話打造真正的「檔案系統」

AI 应用前端 【免费下载链接】voyager Enhancement suite for Gemini, AI Studio, Claude & ChatGPT — plus a prompt manager for any websites, DeepSeek Harness included. / 面向 Gemini、AI Studio、Claude 与 ChatGPT 的增强套件;其中的提示词管理器可用…

📰

gatsby-source-graphql 插件全解析:将任意第三方 GraphQL API 缝合进 Gatsby 数据层

前端静态站点Web框架 【免费下载链接】gatsby React-based framework with performance, scalability, and security built in. 项目地址: https://gitcode.com/gh_mirrors/ga/gatsby 点击查看 免费下载 本篇技术指南以 gatsby-source-graphql 插件的 CHANGELOG 版…

📰

Lightweight Charts v3 到 v4 迁移指南:破坏性变更逐项分析与实战改造方案

Lightweight Charts v3 到 v4 迁移指南:破坏性变更逐项分析与实战改造方案 【免费下载链接】lightweight-charts Performant financial charts built with HTML5 canvas 项目地址: https://gitcode.com/gh_mirrors/li/lightweight-charts 本指南以 Lightweig…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬