Evaluating Retrieval-Augmented Generation Strategies for Large Language Models in Travel Mode Cho... 文章总结与翻译一、文章主要内容该研究聚焦大语言模型(LLMs)在出行方式选择预测中的应用,旨在解决传统统计模型(如多项式logit模型)和机器学习模型(如随机森林、多层感知器)存在的假设僵化、上下文推理能力弱、泛化性差等问题,通过检索增强生成(RAG)技术为LLMs提供实证数据支撑,提升预测准确性。1. 研究框架与方法问题定义:将出行方式选择预测视为多分类问题,目标是基于出行者特征(年龄、性别、收入等)和出行特征(距离、目的、出发时间等),预测出行者选择的交通方式(驾车、步行、公共交通、自行车/微交通)。RAG策略设计:提出4种检索策略并测试,分别是基础RAG、平衡检索RAG、交叉编码器重排序RAG、平衡检索与交叉编码器重排序结合的RAG。模型与数据:采用3种LLM架构(OpenAI GPT-4o、o4-mini、o3),以2023年普吉特湾地区家庭出行调查数据为主要数据集,额外使用2023年塔科马地区调查子集和2022年全国家庭出行调查城市子集评估泛化性,同时以传统统计模型、机器学习模型及零样本LLM为基线模型。评估指标:从准确率、精确率、召回率、F1分数4个维度评估模型性能,多分类任务中采用加权计算方式。2. 核心研究结果RAG提升预测性能: