尧图网络 高端网站定制 · 原创设计
免费咨询热线
400-888-6620
免费获取方案
Aider 基准测试中的 LLM 速度对比:GPT-4 Turbo 与 gpt-3.5-turbo-1106 的推理延迟实测
Aider 基准测试中的 LLM 速度对比GPT-4 Turbo 与 gpt-3.5-turbo-1106 的推理延迟实测【免费下载链接】aideraider is AI pair programming in your terminal项目地址: https://gitcode.com/GitHub_Trending/ai/aider本文为 Aider 基准测试系列的速度专题报告讲解如何借助 aider 的基准测试套件benchmarking suite量化不同 GPT 模型版本的响应速度并给出gpt-3.5-turbo-1106与gpt-4-1106-preview即 GPT-4 Turbo相对 2023 年 6 月版本的加速结论。读完后你将理解这套速度基准到底在测什么、关键加速倍数的来源以及如何用仓库中的 benchmark/benchmark.py 与 benchmark/README.md 复现完整的基准测试流程。背景aider 基准测试与速度测量的范围OpenAI 发布了 GPT-3.5 与 GPT-4 的新版本后社区对它们的能力与性能高度关注。Aider 是一个开源的命令行聊天工具让你与 GPT 协作编辑本地 git 仓库中的代码它依赖一套代码编辑基准来定量评估模型表现。本报告是该系列报告的延续专门比较各 GPT 模型的速度此前的报告可参考GPT 代码编辑基准评估 3 月版与 6 月版的 GPT-3.5 和 GPT-4OpenAI 1106 模型的代码编辑能力基准比较旧模型与 11 月1106模型。速度基准的测量口径需要说清楚Aider 的基准测量的是 OpenAI chat completion 端点的响应时间——每次让 GPT 解答基准套件中的一道编程题时记录等待模型响应所用的时间。也就是说它衡量的是这些模型生成以源代码为主的响应有多快而不包含本地单元测试执行、环境准备等耗时。从当前仓库源码看这一测量落在 benchmark/benchmark.py 的单题执行流程中每次尝试try前记录start time.time()调用coder.run(...)完成模型请求 应用编辑的全过程后执行dur time.time() - start见 benchmark/benchmark.py#L848-L865单元测试run_unit_tests在这段计时之外执行超时则单独计入test_timeouts统计。因此该时间度量聚焦于模型侧的响应速度与原文档中仅测量等待 OpenAI 响应的时间的描述一致。参与对比的模型版本与核心结论本次报告对比的模型版本覆盖了 GPT-3.5 的 3 月版0301、6 月版0613、11 月版1106以及 GPT-4 的 6 月版0613和 11 月预览版1106即 GPT-4 Turbo。原文档给出的三个关键观察是GPT-3.5 快了 611 倍。gpt-3.5-turbo-1106比此前一直作为默认gpt-3.5-turbo的 6 月0613版本快 611 倍。GPT-4 Turbo 快了 22.5 倍。新的gpt-4-1106-preview模型比此前作为默认gpt-4的 6 月0613版本快 22.5 倍。意外发现3 月0301版的 GPT-3.5 实际上比 6 月0613版更快。这三条结论意味着如果你当时的默认配置仍指向gpt-3.5-turbo0613或gpt-40613切换到 1106 版本后纯等模型出答案的等待时间会大幅下降而 3 月版更快的现象则提醒我们模型速度并非随发布日期单调提升需要实测确认。从源码看速度数据如何产生要复现并理解上述倍数结论值得看一下基准套件中速度从采集到汇报的完整链路单题计时benchmark/benchmark.py 中每道题按tries次尝试循环每次尝试的时间累加进durL848-L865最终随题目结果一起写入results字典的duration字段L949。汇总统计summarize_results把所有题目的duration累加到res.durationL514并除以已完成题目数得到每题平均耗时以seconds_per_case输出L611-L612。报告字段基准报告是一段 YAML 记录除pass_rate_1、pass_rate_2等通过率外也包含速度字段seconds_per_case与成本字段total_cost。benchmark/README.md 中给出的示例报告即有- dirname: 2024-07-04-14-32-08--claude-3.5-sonnet-diff-continue model: claude-3.5-sonnet pass_rate_1: 57.1 pass_rate_2: 77.4 seconds_per_case: 17.6 total_cost: 3.6346也就是说速度指标在 aider 的基准报告中与通过率、成本是并列的一等公民这正是本报告能以同一套实验直接横向比较不同模型速度的原因。如何复现基准测试以下流程来自 benchmark/README.md。需要强调的是基准测试会把 LLM 生成的代码未经人工审查直接执行因此必须运行在 docker 容器内以防止 LLM 生成危险代码例如import os; os.system(sudo rm -rf /)危害系统。一次性准备# 克隆 aider 仓库本仓库可用如下地址克隆 git clone https://gitcode.com/GitHub_Trending/ai/aider.git cd aider # 在 aider 主目录下创建存放基准结果的目录 mkdir tmp.benchmarks # 克隆存放练习题的 polyglot-benchmark 仓库Aider-AI 组织维护 # 放到 tmp.benchmarks/polyglot-benchmark # 构建 docker 容器 ./benchmark/docker_build.sh运行基准# 启动 docker 容器 ./benchmark/docker.sh # 容器内以开发模式安装 aider运行你克隆的代码 pip install -e .[dev] # 运行基准测试 ./benchmark/benchmark.py a-helpful-name-for-this-run \ --model gpt-3.5-turbo --edit-format whole --threads 10 \ --exercises-dir polyglot-benchmark运行后会在tmp.benchmarks/YYYY-MM-DD-HH-MM-SS--a-helpful-name-for-this-run下生成结果目录所有练习题默认按随机顺序执行。对速度对比实验最有用的参数包括--model模型名与直接传给aider的参数一致--edit-format编辑格式与传给aider的一致实验性模型建议从whole开始--threads并行执行的练习题数量。调试阶段用单线程稳定后可提高到 10README 指出对 OpenAI API 而言 10 个线程工作良好--num-tests限制运行前 N 个测试便于小规模试跑--keywords只运行名称匹配的测试类似pytest -k。生成报告# 无需进容器即可统计只收集数据不执行不安全代码 ./benchmark/benchmark.py --stats tmp.benchmarks/YYYY-MM-DD-HH-MM-SS--a-helpful-name-for-this-run报告中的model、edit_format、commit_hash三个字段应当足以可靠地复现任何一次基准运行——这是比较不同模型速度时保证实验可比的前提。适用前提与结果有效性说明速率限制的影响本报告于 2023 年 11 月 14 日最后更新。当时 OpenAI 放宽了速率限制因此文中数据不再被视为初步preliminary结果。速率限制会直接影响并行基准的实际吞吐复现时应留意 API 侧限制与--threads设置的匹配。测量边界该速度指标只覆盖模型生成响应所用的时间含 aider 侧应用编辑的过程不含单元测试执行因此它反映的是模型推理速度而非端到端任务耗时要评估端到端体验还需结合pass_rate与total_cost综合判断。时间维度文中对比的gpt-4-1106-preview、gpt-3.5-turbo-0613等均为 2023 年 11 月时点的模型快照其速度结论描述的是那一版本代际的相对差异模型目录与默认模型随 OpenAI 的版本更迭而变化当前仓库的 benchmark/README.md 与 benchmark/benchmark.py 已支持多语言polyglot基准用同一套流程即可对任意新模型重新测速。小结aider 的速度基准用统一的编程题集合与计时口径把哪个模型回答得更快变成了一个可复现、可报告的问题gpt-3.5-turbo-1106相比 0613 版本提速 611 倍gpt-4-1106-preview相比 0613 版本提速 22.5 倍而 0301 版意外地比 0613 更快。借助 benchmark/benchmark.py 中的逐次尝试计时与seconds_per_case汇总字段你可以在 docker 隔离环境中对任意模型组合重复这套测量把速度数据与通过率、成本放在一起比较从而为日常开发选择合适的模型版本。【免费下载链接】aideraider is AI pair programming in your terminal项目地址: https://gitcode.com/GitHub_Trending/ai/aider创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED

相关推荐

SpringBoot+Vue+MySQL校园疫情防控毕设实战指南

SpringBoot+Vue+MySQL校园疫情防控毕设实战指南

毕业设计这东西,选对题目基本就成功了一大半。如果一个题目能同时满足“技术栈主流、业务逻辑完整、有实际应用场景、代码量适中、论文好写”这几个条件,那它就是传说中的“神仙题目”。今天我想认真聊聊这个经典组合——SpringBootVueMySQL打造的校园疫…

📅 2026/9/8 22:19:19
如何在电脑上运行PS3游戏?RPCS3模拟器零基础上手实操指南

如何在电脑上运行PS3游戏?RPCS3模拟器零基础上手实操指南

如何在电脑上运行PS3游戏?RPCS3模拟器零基础上手实操指南 【免费下载链接】rpcs3 PlayStation 3 emulator and debugger 项目地址: https://gitcode.com/GitHub_Trending/rp/rpcs3 PS3已经停产多年,手里那份压箱底的《神秘海域》光盘却再也插不进…

📅 2026/9/8 22:19:19
1GB 文本分词提速 3 倍:tiktoken BPE 分词器五分钟跑通

1GB 文本分词提速 3 倍:tiktoken BPE 分词器五分钟跑通

1GB 文本分词提速 3 倍:tiktoken BPE 分词器五分钟跑通 【免费下载链接】tiktoken tiktoken is a fast BPE tokeniser for use with OpenAIs models. 项目地址: https://gitcode.com/GitHub_Trending/ti/tiktoken 一 GB 文档集卡在分词这一步,终端…

📅 2026/9/8 22:19:19
MORE NEWS

更多资讯

📰

基于VHDL的FPGA倒车雷达设计与实现:超声波测距+数码管显示+蜂鸣器报警

简介:一套基于VHDL的倒车雷达完整工程,面向FPGA数字电路学习者、电子竞赛备赛者以及汽车电子方向开发者。项目采用超声波探测方案,通过VHDL实现分频计时、距离计算与声光报警等核心逻辑,可有效模拟倒车辅助系统的工作流程&#xf…

📰

Adreno Neural Fusion:移动端GPU架构的范式革命

1. 这不是“又一颗新GPU”,而是移动计算架构的临界点跃迁 最近刷到“骁龙8Gen6 Adreno Neural Fusion GPU”这个命名,第一反应不是兴奋,而是皱眉——这串词里藏着三个被行业悄悄改写定义的关键词:“Adreno”不再是单纯图形处理器&…

📰

Ant Design Popover 实现“悬停 + 点击”双触发浮层:基于受控状态的嵌套 Popover 方案

Ant Design Popover 实现“悬停 点击”双触发浮层:基于受控状态的嵌套 Popover 方案 【免费下载链接】ant-design An enterprise-class UI design language and React UI library 项目地址: https://gitcode.com/GitHub_Trending/an/ant-design 本文围绕 An…

📰

DragonFace 2.2.3 全志IMG固件解包打包实战指南

简介:Dragonface2.2.3是一款专门面向全志处理器固件二次开发场景的图形化工具,支持对IMG格式固件解包、查看/修改文件系统并重新打包,解决开发者与DIY爱好者个性化定制系统时缺少便捷可视化工具的痛点。压缩包为7z格式,共506个文件…

📰

ESP32物联网演示台:从传感器到云平台的全链路实践

1. 为什么一块小板子能撑起整个物联网演示台?——从“口红说物联网”到真实数据链路的落地逻辑你可能在短视频里刷到过“口红说物联网”——一支口红大小的设备,讲清楚了传感器怎么采集、网关怎么转发、云平台怎么收数据。听起来像段子,但背后…

📰

macOS 磁盘修复实战:磁盘工具提示“无法修复“时,DiskWarrior 怎么用

macOS 磁盘修复实战:磁盘工具提示"无法修复"时,DiskWarrior 怎么用 【免费下载链接】awesome-macOS  A curated list of awesome applications, softwares, tools and shiny things for macOS. 项目地址: https://gitcode.com/GitHub_Tre…

TODAY

今日更新

THIS WEEK

本周精选

THIS MONTH

本月热门

读完文章,想聊聊您的网站?

告诉我们您的行业与需求,资深顾问一对一梳理方案与报价,全程免费。

📞 💬