AI测试简介 理论对标由于AI时代的到来测试工作的可替代性变得逐渐提高作为一个测试人员我认为未来的发展是多元化的要想不被时代淘汰我认为需要取学习AI利用AI积极拥抱AI。关于AI测试工作的发展我大致理解成两个层面物理层面也就是服务器它包括CPU内存主板GPU磁盘等他的主要关注点为硬件功能硬件兼容存储能力计算能力网络带宽资源稳定性与恢复能力。(不细讲)层面主要内容针对工具测试要点固件驱动相关固件的使用功能与适配例如BIOSBMC网卡驱动ipmitoolUEFI Shell固件版本驱动安装识别加载。BIOS的配置生效与还原默认BMC远程控制开关机web端的日志收集查看与配置修改还原硬件CPU主板硬盘网卡内存条一般来说在BMC或者BIOSLinux OS下查看硬件功能正常型号识别频率温度压力稳定性延迟丢包槽口拓展。软件层面也是就实际的AI运行软件它主要包括层面主体主要内容测试要点软件环境OSOS与AI软件的适配系统兼容性、资源识别、系统稳定性驱动驱动与服务器的适配网卡驱动安装、版本兼容、设备识别AI计算环境GPU计算和通信基础库版本匹配、算子运行、多卡通信AI软件AI资源调度AI运行环境隔离及资源调度容器启动、GPU分配、资源隔离、弹性扩容AI框架模型开发、训练和推理框架框架兼容性、算子正确性、训练稳定性模型训练软件模型训练及分布式训练组件训练精度、多机多卡效率、断点恢复模型与算法模型权重、网络结构、Tokenizer及算法逻辑准确性、鲁棒性、泛化性、偏见与幻觉推理引擎模型转换、加速及推理执行推理正确性、延迟、吞吐量、显存占用数据与知识库训练数据、测试数据、向量数据及业务数据数据完整性、一致性、检索召回率、数据安全模型服务将模型封装并提供API服务接口功能、并发能力、超时、限流、可用性AI应用RAG、智能体、问答系统及业务应用回答质量、工具调用、任务成功率、异常处理运维监控日志、指标、链路追踪及告警资源监控、异常告警、日志完整性、故障定位安装与权限身份认证、访问控制及AI安全防护越权访问、提示词注入、隐私泄露、内容安全实际岗位AI质量工程师AI产品的整体质量保证包括数据质量模型评估系统集。LLM评测工程师大语言模型的评测包括准确性安全性幻觉率指令遵循。MLOps测试工程师ML流水线的测试与监控确保模型训练部署推理的可靠性AI安全工程师AI系统的安全性包括攻击提示注入数据泄露。数据质量工程师训练数据和推理数据的质量保障包括标注质量偏差检测。需要拥有的能力编程能力熟练掌握 Python 编程语言能够使用 Pandas 进行数据清洗、转换和分析利用 NumPy 进行高效的数值计算和数组操作。具备编写可维护、可测试的代码能力熟悉面向对象编程和函数式编程范式。AI基础深入理解机器学习ML和深度学习DL的基本概念包括监督学习、无监督学习、强化学习等范式。掌握常见算法原理如线性回归、逻辑回归、决策树、随机森林、支持向量机、神经网络、卷积神经网络CNN、循环神经网络RNN、Transformer 等了解其数学推导、适用场景和优缺点。统计学熟悉概率分布如正态分布、泊松分布、二项分布、假设检验t检验、卡方检验、ANOVA、置信区间、p值等统计推断方法。掌握机器学习评估指标如准确率、精确率、召回率、F1分数、AUC-ROC、均方误差MSE、平均绝对误差MAE等能够正确评估模型性能。LLM知识理解 Transformer 架构的核心组件包括自注意力机制、位置编码、前馈网络、编码器-解码器结构等。掌握 Prompt Engineering 技巧能够设计有效的提示词来引导大语言模型生成高质量、符合预期的输出包括零样本学习、少样本学习、思维链CoT等策略。数据工程具备数据清洗能力能够处理缺失值、异常值、重复数据和不一致数据。掌握特征工程方法包括特征选择、特征提取、特征缩放和特征编码。了解数据管道Data Pipeline的构建能够使用 Airflow、Luigi 等工具实现数据的自动化抽取、转换和加载ETL/ELT。MLOps熟悉模型部署流程能够将训练好的模型打包为 Docker 镜像并通过 REST API 或 gRPC 提供服务。掌握模型监控方法跟踪模型性能衰减、数据漂移和概念漂移。了解持续集成/持续部署CI/CD在机器学习项目中的应用实现自动化测试、构建和部署。AI安全了解对抗攻击Adversarial Attacks的基本原理和防御方法如 FGSM、PGD 等攻击算法。掌握偏见检测技术识别和缓解训练数据及模型预测中的偏见问题。熟悉隐私保护技术如差分隐私Differential Privacy、联邦学习Federated Learning等确保数据在使用过程中的安全性。云平台熟悉主流云平台AWS、Azure、GCP提供的 AI 服务如 AWS SageMaker、Azure Machine Learning、Google AI Platform。了解如何使用这些平台的托管服务进行模型训练、部署和管理以及如何与云存储、计算资源和监控服务集成。