用 Gemini 3.7 Flash 搭一个能干活的 Agent:从第一次调用到生产级架构 用 Gemini 3.7 Flash 搭一个能干活的 Agent从第一次调用到生产级架构Google 在 2026 年 8 月 13 日发布了 Gemini 3.7 Flash官方给它的定位是面向编程和智能体的工作马模型workhorse model for coding and agents。发布距上一代 3.6 Flash 只有三周输入价格砍半到 $0.75/百万 token模型 IDgemini-3.7-flash已经 GA。版本号看着不起眼但它是目前把Agent 循环这条路走得最完整的模型之一可调的思考力度、服务端托管的多轮状态、原生工具调用、外加一个可以直接调用的托管 Agent。这篇文章只讲一条主线——怎么用 3.7 Flash 从零搭出一个 Agent并把它带到生产环境。内容按六层递进每一层都建立在前一层之上代码全部来自官方文档可以直接运行。第一层跑通第一次调用环境准备只有两步pip install google-genai注意版本要1.55.0 以上Interactions API 是从这个版本开始支持的然后去 Google AI Studio 申请一个 API Key放到环境变量GEMINI_API_KEY里。fromgoogleimportgenai clientgenai.Client()# 自动读取 GEMINI_API_KEYinteractionclient.interactions.create(modelgemini-3.7-flash,input写一个 three.js 脚本渲染一个写实的 3D 黑洞)print(interaction.output_text)这里有个新的 API 形态值得注意入口不是熟悉的generate_content而是interactions.create。这是 Google 主推的 Interactions API把一次模型交互做成服务端资源。它和generateContent的关系后面第六层会详细说先记住两点返回对象上有便捷属性output_text、output_image、output_audio直接拿最终结果对象内部还有一个steps时间线记录了模型的思考、工具调用、中间结果调试 Agent 时非常有用。不依赖 SDK 的话REST 也一样curlhttps://generativelanguage.googleapis.com/v1beta/interactions\-Hx-goog-api-key:$GEMINI_API_KEY\-HContent-Type: application/json\-XPOST\-d{ model: gemini-3.7-flash, input: 写一个 three.js 脚本渲染一个写实的 3D 黑洞 }跑通这一步你已经有了一个 1M token 上下文、最大 64K 输出的模型。下面开始把它变成 Agent。第二层thinking_level——这个模型唯一的旋钮用过老版 Gemini API 的人第一件事可能是调temperature。在 3.x 系列上这条路走不通了temperature、top_p、top_k、candidate_count这些采样参数全部移除传了直接报错。取而代之的是一个语义更直白的参数——thinking_level三档档位适用场景特点low告警响应、实时聊天、初稿、快速数据清洗延迟最低思考最少medium默认大多数任务复杂代码和 Agent 场景的推荐档质量与延迟平衡high硬推理、复杂架构问题、最难的 Agent 任务允许更长的思考和更多轮工具调用token 消耗明显上升interactionclient.interactions.create(modelgemini-3.7-flash,input分析这段支付重试逻辑中的竞态条件并安全地重写事务锁,generation_config{thinking_level:high# 攻坚任务拉满})为什么砍掉采样参数因为推理模型的输出质量主要不靠采样分布控制而靠花多少算力思考。与其让开发者对着 temperature 玄学调参不如给一个含义明确的旋钮。这个设计带来的实际好处是一个模型通过分档就能覆盖过去小模型走量 大模型攻坚的组合路由逻辑写在代码里就行第六层会用到这一点。第三层多轮对话别再自己拼历史了搭 Agent 绕不开多轮。传统做法是把历史消息在客户端拼成一个越滚越大的 messages 数组每轮请求都全量重发。Interactions API 提供了另一种方式对话状态存在服务端客户端只传一个 ID。# 第一轮firstclient.interactions.create(modelgemini-3.7-flash,input我的项目是个 Spring Boot 2.7 的单体应用最近启动要 3 分钟)# 第二轮只传 ID不用重发任何历史secondclient.interactions.create(modelgemini-3.7-flash,input先从日志分析入手给我具体的排查命令,previous_interaction_idfirst.id)两种模式的对比Interactions服务端管状态每轮只传previous_interaction_id服务端取回完整历史命中隐式缓存费用更低历史不会截断代码里没有状态管理传统模式客户端管状态每轮请求全量重发历史消息历史拼装逻辑写在你的代码里token 费用随轮数线性涨上下文容易截断出错这里有三个官方文档里写了、但很容易踩的细节1.previous_interaction_id只继承对话历史其它参数每轮要重传。tools、system_instruction、generation_config都是 interaction 级的不在历史里。也就是说你在第一轮配好了工具和系统指令第二轮忘了传模型会失忆——不是忘了对话而是忘了自己有什么工具、是什么角色。这是用服务端状态最容易踩的坑。2. 留存期有边界。服务端默认存储所有 Interactionstoretrue付费层保留 55 天免费层只有 1 天。超过保留期的 ID 无法续接对话。如果你的 Agent 会话可能跨越很长时间要么自己做 checkpoint要么把关键上下文显式写进新请求。3.storefalse与两个功能互斥。出于合规不想让 Google 存数据时可以设storefalse但这样就不能再用previous_interaction_id服务端没历史可取也不能用backgroundtrue后台执行。鱼和熊掌要选好。第四层接上工具让它真正干活前三层还是聊天。Agent 的分界线是工具调用模型决定调用什么函数你的代码执行它把结果喂回去模型继续思考直到给出最终答案。这个循环跑起来模型才变成 Agent。流程是这样的function_call(函数名 参数)function_result(带上 call_id)还有缺口信息足够任务输入gemini-3.7-flash思考 规划你的代码执行函数最终输出官方对 DeepSWE v1.1 基准的说明可以直接映射到这张图上3.6 Flash 在真实开源仓库里自主修 issue 的成功率是 49.0%3.7 Flash 提到 65.3%。这个基准考察的正是上图循环的完整能力——读代码、定位、改代码、跑测试、根据报错再来一轮。提升最大的部分官方归因于 “reducing failed agent loops”即循环卡死的次数变少了。做过 Agent 的人都知道卡死循环反复调同一个工具、在两步之间横跳、提前放弃才是最痛的问题比单轮智力不足痛得多。写工具调用时官方文档的几条硬性规范函数执行结果回传时FunctionResponse里必须带call_id和namegenerateContent路径下强制。call_id来自模型发的function_call用来把结果和调用配对缺了会直接报错多模态资源比如函数返回的图片要放在 response payload 内部不要外挂内联指令之间用\n\n分隔遇到Malformed_Function_Call报错先检查工具调用前是否有多余文本官方有专门的 pre-tool text 要求和对应 workaround。另外一个很多人关心的能力现状Gemini 3 目前还不支持远程 MCP官方文档明确写了 coming soon。想接 MCP 工具的现阶段只能把 MCP server 的能力包一层本地函数再做工具声明。第五层把整个循环外包——Antigravity 托管 Agent第四层的循环是自己搭的。3.7 Flash 同时支持另一条路循环本身也交给 Google。调用时不传model改传agent任务会在远端环境里自主执行——这正是发布当天官方把 Antigravity Agent 默认模型切到 3.7 Flash 的原因。interactionclient.interactions.create(agentantigravity-preview-05-2026,input(审计 https://web.dev 的性能、Core Web Vitals 和 SEO。分别用 Mobile 和 Desktop 两种策略查询 PageSpeed Insights API用 Google 搜索检查 site:web.dev 的收录情况输出一张并排的评分表按优先级列出修复建议。),environmentremote,)这段代码执行时发生的事interactions.createagentantigravity自主规划步骤多轮工具调用汇总输出你的应用Gemini APIAntigravity Agent(默认 3.7 Flash)Google 远端环境PageSpeed APIGoogle 搜索自建循环第四层和托管 Agent第五层怎么选自建循环Antigravity 托管工具完全自定义接自己的业务系统平台提供的工具集可观测性每一步自己记日志完全透明通过 steps 时间线观察控制粒度每轮可介入、可人工审批整任务委托适合业务系统集成、需要审批流的场景开放式调研、审计、信息收集还有一条官方文档里比较冷门但很实用的玩法Agent 和模型可以在同一个对话里混用。比如先用 Deep Research Agent同样通过agent参数调用做一轮资料收集拿到interaction.id后用previous_interaction_id接一个普通的gemini-3.7-flash调用做总结和重排版。重活脏活给 Agent精细排版给模型中间只需要传一个 ID。第六层上生产前的三件事6.1 先算清 token 账Agent 的成本结构和聊天完全不同。每轮循环都要把上下文重新喂一遍输入 token 是绝对大头。以一个中等复杂度的编码任务为例典型消耗约 50 万输入 5 万输出 token项目介绍期价格至 2026-12-312027 年起输入 50 万 token$0.375$0.75输出 5 万 token$0.1875$0.375单任务合计$0.56$1.13两个直接影响架构的结论第一介绍价 12 月 31 日到期后翻倍$1.50/$7.50做预算必须按 2027 年原价算现在的半价当红利看第二既然输入是大头凡是能降输入的手段收益都大——第三层说的previous_interaction_id命中隐式缓存就是官方明确建议的降本手段。6.2 分层路由把三档思考力度当三个模型用结合第二层的thinking_level和价格一个可直接落地的生产架构简单格式转换、初稿、分类中等常规编码、文档处理困难架构决策、疑难 Bug连续失败/超时自动升档任务进入路由规则按任务复杂度3.7 Flashthinking_levellow3.7 Flashthinking_levelmedium旗舰模型(升级路径)结果 复杂度反馈路由规则不用复杂任务类型加一个失败重试计数就够。关键是把失败或超时自动升档做进去——3.7 Flash 在 low 档解决不了的问题先升 medium再不行才动用贵的旗舰模型。这样大部分流量被 $0.75 的价格承接贵的模型只花在刀刃上。6.3 稳定性Interactions API 还是 beta官方文档目前的原话是Interactions API 处于 betaschema 可能发生破坏性变更生产工作负载建议继续使用标准的generateContentAPI。所以现实的做法是新项目、内部工具、快速验证直接上 Interactions API开发体验好得多对外生产服务模型用gemini-3.7-flash接口走generateContent模型本身是 GA 的只是 API 形态的选择等 Interactions API 转正再迁移两条路线的差异点记住几个就够Interactions 暂不支持 Batch API、显式缓存隐式缓存有、Python 的自动函数调用和 video_metadata迁移时采参数清理见下面清单。从旧模型迁移的清理清单官方迁移指南的浓缩版按顺序过一遍全仓库搜索temperature/top_p/top_k/candidate_count删干净传了就报错thinking_budget数字替换为thinking_level字符串枚举多轮对话统一改用previous_interaction_id删掉预填充模型回复的写法generateContent路径下检查每个FunctionResponse都带call_id和namePython SDK 升到 1.55.0JS SDK 升到 1.33.0成本模型按 2027 年价格重算。写在最后把六层串起来回看第一次调用跑通→ thinking_level调速→ 服务端状态管历史→ 工具循环变 Agent→ 托管 Agent外包循环→ 分层路由与成本进生产。3.7 Flash 这个模型的价值不在单项参数而在于这条链路上每一环都有官方一等公民的支持且价格低到可以放心让它在循环里反复跑。介绍价到年底试错成本正处于最低点。如果你手头有一个一直想自动化的多步骤任务现在是用真实负载验证这条链路的好时机——官方基准DeepSWE 65.3%、AutomationBench 30.4%终究是别人的数字自己的任务跑一遍才有发言权。参考均为官方一手来源Introducing Gemini 3.7 Flash — Google 官方发布2026-08-13What’s new in Gemini 3.7 Flash — Gemini API 官方文档2026-08-26 更新Interactions API 总览 — 官方文档Gemini 3.7 Flash 模型卡 — Google DeepMindDeepSWE v1.1 榜单 — DatacurveAutomationBench — Zapier 官方博客Google Antigravity