M50 软件平台最佳实践指南
1.4.0
目录
1. 更新历史
2. 概述
3. 精度评估与优化
4. 性能调优指南
版权声明
M50 软件平台最佳实践指南
»
最佳实践指南
最佳实践指南
目录
1. 更新历史
2. 概述
2.1. 文档目标
2.2. 目标读者
2.3. 适用场景
3. 精度评估与优化
3.1. 流程
3.2. 精度评估工具
3.3. 小模型(CV/检测/分类/分割)
3.3.1. 常见精度问题
3.3.2. 基础概念说明
3.3.3. 使用方法
3.3.3.1. 环境依赖
3.3.3.2. 环境配置
3.3.3.3. 操作步骤
3.3.4. 定位与优化
3.3.4.1. onnx vs hmquant值偏低
3.3.4.1.1. 量化调优
3.3.4.2. hmquant vs xh2值偏低
3.3.4.3. 推理结果异常但输出相似度正常
3.4. LLM模型
3.4.1. 常见精度问题
3.4.2. 使用方法
3.4.2.1. 环境依赖和配置
3.4.2.2. 预置模型评测示例
3.4.2.2.1. Qwen3-8B示例
3.4.2.3. 精度指标说明
3.4.2.4. 指令说明
3.4.2.5. 自定义模型评测脚本
3.4.2.5.1. 必要条件
3.4.2.5.2. 脚本推荐模板
3.4.3. 定位与优化
3.4.3.1. 原始模型正常,编译后模型分数下降
3.4.3.1.1. 量化调优
3.4.3.2. 单条样本回答异常
3.4.3.3. 评测分数低,但人工判断回答正确
4. 性能调优指南
4.1. 流程
4.2. 性能评估工具
4.3. 性能问题映射表
4.4. 小模型(CV/检测/分类/分割)性能瓶颈定位
4.4.1. 使用方法
4.4.1.1. 环境依赖
4.4.1.2. 运行环境
4.4.1.3. Linux环境准备
4.4.1.4. Android环境准备
4.4.1.5. Windows环境准备
4.4.1.6. 指令说明
4.4.2. 端到端耗时和纯推理耗时
4.4.3. 关键指标与瓶颈判断
4.5. LLM/VLM模型性能瓶颈定位
4.5.1. 使用方法
4.5.1.1. 环境依赖
4.5.1.2. 运行环境
4.5.1.3. Linux环境准备
4.5.1.4. Windows环境准备
4.5.1.5. Android环境准备
4.5.1.6. 指令说明
4.5.2. 瓶颈判断
4.5.2.1. Prefill阶段瓶颈判断
4.5.2.2. Decode阶段瓶颈判断
4.5.2.3. Vision 阶段瓶颈判断
4.6. 性能调优方法
4.6.1. 主机/数据传输性能瓶颈
4.6.2. 模型计算性能瓶颈
4.6.2.1. 量化策略优化
4.6.2.2. 编译参数调优
4.6.2.3. 计算图优化
4.6.2.3.1. 适用场景
4.6.2.3.2. 开启图优化
4.6.2.3.3. 扩展自定义图优化规则