2. 概述
本文档面向已完成模型部署、需要进一步验证模型精度和优化推理性能的用户,提供模型推理部署后的精度评估、性能评估、问题定位和调优方法。通过本文档,用户可了解如何根据模型类型选择合适的评估工具,如何判断精度或性能问题来源,以及如何通过量化策略、编译参数、计算图优化、主机侧优化和系统配置优化等方式完成调优闭环。
在阅读本文档前,建议用户已具备以下基础:
已完成后摩设备硬件安装、驱动安装、固件升级和软件环境部署。
已了解模型量化、模型编译和模型推理的基本流程。
已能够使用模型转换与评估工具、模型推理性能评测工具或 LLM 推理性能评测工具完成基础评测。
已具备基本的模型输入输出、预处理、后处理、batch、上下文长度、Prefill、Decode 等概念理解。
2.1. 文档目标
本文档旨在帮助用户完成以下任务:
建立模型部署后的精度和性能评估流程。
根据模型类型选择合适的精度评估工具和性能评测工具。
判断模型精度问题来源,包括量化阶段、编译阶段、推理处理阶段和评测阶段。
判断模型性能瓶颈类型,包括主机/数据传输性能瓶颈、模型计算性能瓶颈、系统资源问题和测试配置问题。
针对不同瓶颈选择对应优化方法,例如量化策略优化、编译参数调优、计算图优化、输入输出优化、数据预拷贝、buffer 复用和系统资源优化。
在优化后重新执行精度评估和性能评测,确认调优效果并避免引入精度回退或性能回退。
本文档重点说明模型部署后的精度问题定位、性能瓶颈分析和调优闭环,帮助用户在模型已能正常运行的基础上,进一步提升推理结果一致性、运行效率和端到端性能。
2.2. 目标读者
本文档适用于以下用户:
模型部署工程师:需要将模型部署到后摩M50设备,并验证模型精度和性能。
算法工程师:需要分析量化、编译或推理处理对模型精度的影响。
性能优化工程师:需要定位推理链路中的性能瓶颈,并选择合适的优化策略。
应用开发工程师:需要优化业务端到端推理体验,例如降低首token延迟、提升生成速度或提高端到端吞吐。
技术支持工程师:需要根据用户提供的评测结果、日志、模型文件和配置,进一步分析复杂模型或特殊场景问题。
2.3. 适用场景
本文档适用于以下场景:
模型已完成量化、编译或部署,但需要验证编译后模型精度是否满足预期。
模型在后摩M50设备上可以正常运行,但推理速度、吞吐率或端到端延迟不达预期。
小模型推理过程中
Input、Output、Inference、End2End或qps指标异常。LLM/VLM 推理过程中
TTFT、TPOT、Prefill Speed、Decode Speed或E2E TPS不达预期。需要区分性能问题来自主机侧前后处理、数据传输、模型计算、系统资源,还是测试配置不一致。
调整量化策略、编译参数或图优化配置后,需要重新验证性能和精度结果。
需要将性能评测结果、Profiler 数据、模型文件和编译配置提供给技术支持工程师进一步分析。