如何为InferenceX添加新模型或新GPU基准:Master YAML配置实战教程

发布时间:2026/10/11 14:58:18

如何为InferenceX添加新模型或新GPU基准:Master YAML配置实战教程 人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载InferenceX 是一个开源 AI 推理加速器研究平台Open Source AI Accelerator Research Platform用标准化基准衡量大模型推理性能。想为它添加一个新模型或新 GPU 基准你只需要在 inferencex-e2e/configs/ 目录里写好一份 Master YAML 配置。本教程带你从零到提交一步步完成配置、校验与上线全流程。1️⃣ 配置体系总览Master YAML 是唯一事实来源InferenceX 的基准配置全部集中在inferencex-e2e/configs/目录每个文件按硬件平台划分文件用途nvidia-master.yamlNVIDIA GPUH200/B200/B300 等基准配置amd-master.yamlAMD GPUMI355X 等基准配置runners.yaml可调度 runner 标签与集群静态信息ci-priority.yamlCI 作业调度优先级打分CONFIGS.md 官方配置格式参考手册每个配置条目的键名entry-name有约定俗成的格式模型前缀-精度-GPU-框架例如qwen3.5-fp4-b200-sglang。名字起得规范维护者一眼就能看懂你要跑什么。⚠️重点提醒配置由 Pydantic 模型做严格校验见 infx/matrix/validation.py且设置了extraforbid——任何未定义的字段都会直接报错矩阵生成失败。写配置前建议先读一遍 CONFIGS.md。2️⃣ 新条目必写的 6 个核心字段不管加什么基准每个条目都要回答四个问题用什么镜像跑、跑什么模型、在哪台机器上、以什么精度和框架dsr1-fp4-mi355x-sglang: image: lmsysorg/sglang:v0.5.12-rocm700-mi35x # 1. 推理服务容器镜像 model: amd/DeepSeek-R1-0528-MXFP4-Preview # 2. 模型Hugging Face 风格路径 model-prefix: dsr1 # 3. InferenceX 规范模型前缀 runner: mi355x # 4. 目标 runner 标签 precision: fp4 # 5. 精度fp8/fp4/bf16… framework: sglang # 6. 推理框架vllm/sglang/trt…model-prefix是核心系统靠它决定调用 benchmarks/ 下哪个启动脚本。可用的前缀dsr1、dsv4、qwen3.5、kimik3…请查 docs/MODELS.md 的模型支持矩阵。runner必须是 runners.yaml 中labels下已存在的标签比如mi355x、b300或精确集群标签cluster:b200-nscale。3️⃣ 快速上手单节点固定长度基准最常见的场景是fixed-seq-len固定输入/输出长度。以下取自 amd-master.yaml 的真实条目multinode: false scenarios: fixed-seq-len: - isl: 8192 # 输入序列长度 osl: 1024 # 输出序列长度 search-space: # 要扫描的部署配置 - tp: 4 # 张量并行度 conc-start: 4 # 并发起点 conc-end: 64 # 并发终点含 srt-recipe: benchmarks/single_node/srt-slurm-recipes/dsr1/sglang/mi355x-fp4/8k1k.yaml - tp: 8 conc-start: 4 conc-end: 64 srt-recipe: benchmarks/single_node/srt-slurm-recipes/dsr1/sglang/mi355x-fp4/8k1k.yaml几个新手容易踩的坑并发步长固定为 2conc-start: 4到conc-end: 64实际会跑4, 8, 16, …, 64共 6 个点。想跑指定离散并发用conc-list: [10, 66, 548]见 nvidia-master.yaml 中的用法。tp之外还可以选填ep专家并行默认 1、dp-attn数据并行注意力默认 false、pp、dcp-size、pcp-size。目前主流单轮场景是8k1kISL 8192 / OSL 10241k1k 等旧场景已弃用配置前先确认 MODELS.md 的 Scenarios 表别把 GPU 时间花在已退役的场景上。4️⃣ 进阶添加 Agentic Coding 基准如果新模型主打 Agent 工作负载用agentic-coding场景回放真实对话 trace。下面是 nvidia-master.yaml 中 DeepSeek-V4 的一个真实片段节选agentic-coding: - dram-utilization: 0.90 search-space: - { tp: 8, kv-offloading: none, spec-decoding: draft_model, conc-list: [1, 4, 6, 10, 14, 16], srt-recipe: benchmarks/single_node/srt-slurm-recipes/dsv4/vllm/b200-fp4-mtp/agentic.yaml } - { tp: 8, ep: 8, dp-attn: true, kv-offloading: dram, kv-offload-backend: { name: vllm-simple }, spec-decoding: draft_model, conc-list: [32, 64, 96, 128, 160, 192], router: { name: vllm-router, version: 0.1.14 }, srt-recipe: benchmarks/single_node/srt-slurm-recipes/dsv4/vllm/b200-fp4-mtp/agentic.yaml }新增 agentic 基准时注意runner必须写精确的cluster:name标签如cluster:b200-nscale不能写宽泛的 SKU 标签——保证每个搜索点落在同一批硬件上。KV 缓存卸载kv-offloading: dram是可选能力用量受GPU 占比规则约束详见 MODELS.md 的 KV cache offloading policy。router与kv-p2p-transfer只能在顶层或搜索空间条目二选一声明两处都写会被拒绝。按 MODELS.md 的引擎提交策略新模型应优先使用映射的 native/upstream vLLM 或 SGLang 引擎。5️⃣ 多节点与 Prefill/Decode 分离部署需要跨节点部署或 PD 分离disaggregated时把multinode置为true每个搜索点会拆成prefill和decode两个 worker 池multinode: true disagg: true scenarios: fixed-seq-len: - isl: 1024 osl: 1024 search-space: - conc-list: [64] prefill: hardware: b200 # 异构硬件才需要同构可省略 num-worker: 1 tp: 8 ep: 8 pcp-size: 2 decode: hardware: h100 num-worker: 2 tp: 8 dcp-size: 2要点一个 worker 池占用的 GPU 数为num-worker × tp × pp × pcp-size异构配置一边声明hardware要求两边都声明PD 分离条目通常还需要kv-p2p-transfer指明 KV 传输引擎如nixl。6️⃣ Runner 配置告诉调度器去哪台机器跑如果你的新 GPU 集群还没接入先改 runners.yaml在labels下添加标签并列出 runner 名在clusters下声明集群事实gpus-per-node、调度器、Slurm 分区、模型存放卷等。矩阵生成器会从集群记录读取gpus-per-node等字段用于调度计算权威 schema 见 infx/clusters/ 目录。7️⃣ 提交前本地验证别浪费 GPU 机时好消息是不需要 GPU 就能验证配置。矩阵生成器 infx/matrix/generate.py 会加载 master 配置 runners.yaml做完整 Pydantic 校验后输出 JSON 矩阵。按 docs/ci-procedures.md 的做法在inferencex-e2e/目录下uv run --locked python -m infx.matrix.generate test-config \ --config-files configs/nvidia-master.yaml \ --config-keys 你的条目名 \ --seq-lens 8k1k --conc 4 --no-evals退出码为 0 即说明结构与 schema 全部通过。也可以用full-sweep --model-prefix 前缀做过滤式全量生成再用jq length确认生成的任务点数是否符合预期空输出不算通过。8️⃣ 提交清单一次 PR 里都要带上什么✅ 提交新基准的 PR 时请对照以下清单在对应平台的*-master.yaml中新增条目entry-name 遵循前缀-精度-GPU-框架命名在 docs/MODELS.md 的Model support matrix表格加一行模型前缀、日期、激活场景——官方明确要求加模型同一个 PR 里更新这里按 ci-priority.yaml 了解你的条目会被如何排序模型前缀、精度、投机解码都会影响分数结果记录会进入 perf-changelog.yaml该文件有专门的字节/差异/矩阵三重门禁见 infx/workflows/validate_perf_changelog.py。写在最后掌握 Master YAML你就掌握了 InferenceX 的总开关一个文件定义跑什么模型、在哪块 GPU、用什么并行策略与并发扫描范围。建议的路径是先照抄 amd-master.yaml 里最简单的单节点条目 → 本地test-config验证通过 → 再逐步挑战 agentic 与多节点场景。遇到字段报错永远以 infx/matrix/validation.py 的 Pydantic 模型为准——它才是最终的字段契约。祝你顺利跑出自己的第一个 InferenceX 基准点赞分享人工智能大模型模型评测Agent 评测【免费下载链接】InferenceXOpen Source AI Accelerator Research Platform Standard / 开源推理研究平台项目地址https://gitcode.com/gh_mirrors/in/InferenceX点击查看免费下载相关推荐如何为sorry.xuty.tk添加新模板完整教程如何为sorry.xuty.tk添加新模板完整教程 想要为知名的GIF制作平台sorry.xuty.tk添加新的表情包模板吗本教程将为你详细介绍完整的添加流后端音视频MMDeploy项目教程如何为项目添加新模型支持MMDeploy项目教程如何为项目添加新模型支持 引言 在深度学习模型部署过程中我们经常会遇到需要将训练好的模型转换到不同推理引擎的需求。MMDeploy作MMDeploy项目如何为模型部署添加新模型支持MMDeploy项目如何为模型部署添加新模型支持 引言模型部署的挑战与机遇 在深度学习模型开发过程中训练出一个高精度的模型只是成功的一半。将训练好的模型高创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/10/11 14:58:18

开放集检测加分割实战:GroundingDINO与SAM组合落地指南

简介:结合GroundingDINO与SAM的目标检测与分割增强项目源码,面向计算机视觉算法开发者和研究人员。项目利用GroundingDINO的文本引导定位能力生成目标候选框,再由SAM输出高质量掩码,实现精确识别与细粒度分割,适用于自…

2026/10/11 14:53:18

Oracle项目实战:开放式基金交易平台数据库完整设计

简介:这是一份面向 Oracle 数据库学习者的项目实战资料,围绕开放式基金交易平台的后台数据表设计展开,适合有 SQL 基础、希望锻炼数据库建模与表结构设计能力的读者。资料完整阐述了基金公司、基金、活期账户、理财账户、基金账户、购买基金及…

2026/10/11 14:53:18

轻日历瘦身版实战:绿色安装、自启优化与日程ICS导出指南

简介:轻日历是一款基于人生日历瘦身而来的桌面日历小工具,面向需要快速查看农历、黄历、节假日及日常备忘的普通用户。它在保留天气、便签、记事、纪念日、截图、报时等高频功能的同时,去除了冗余模块,界面清爽、体积小巧&#xf…

2026/10/11 15:58:22

跨江桥梁病害检测与资产标定:YOLOv8数据集构建与训练调参实战

简介:这份资源面向计算机视觉研究者、桥梁监测工程师及目标检测学习者,提供跨江桥梁路面病害与道路资产标定的专用数据集,用于训练裂缝、破损、积水等病害及桥墩、拉索、桥面等结构元素的识别模型,弥补通用数据集在桥梁场景下的适…

2026/10/11 15:58:22

跨江桥梁病害检测与资产标定:YOLOv8训练全流程与避坑指南

简介:这份资源面向计算机视觉研究者、桥梁工程监测人员及目标检测学习者,提供跨江桥梁路面病害与道路资产标定的专用数据集,用于训练裂缝、破损、积水等病害及桥墩、拉索、桥面等结构元素的识别模型,弥补通用数据集在桥梁场景下的…

2026/10/11 15:58:22

ScriptX打印控件详解:ActiveX安装激活与静默打印实战

简介:ScriptX打印控件安装包是一套面向Windows环境的打印控件部署文件,主要服务于需要在浏览器或桌面应用中调用本地打印机完成票据、报表等文档输出的场景。无论是前端开发、系统集成还是IT运维,都可以借助这份安装包快速解决ScriptX打印组件…

2026/10/11 15:58:22

显示驱动板卡电容触控校准原理与实操指南

1. 从一块“飘移”的触控板说起如果你拆过带触控功能的显示模组,大概率见过这样一块板子:上面密密麻麻排着走线,边缘引出一排FPC座子,中间一颗主控芯片旁边围着几颗电容和电阻。这块板子就是显示驱动板卡,它同时干两件…

2026/10/11 15:58:22

鸿蒙Flutter BLE透传数据错乱?CRC16校验实战与避坑指南

前阵子在鸿蒙设备上调试一个 Flutter 的 BLE 透传模块,遇到一个挺磨人的问题。两块开发板通过串口转发数据,偶尔会多收、漏收或者错一两个字节,设备端的动作就跟着乱套。查了半天链路层,最后发现根本不是蓝牙连接问题,…

2026/10/11 15:53:21

Linux连接跟踪机制解析:从conntrack命令到生产环境排查

排查生产环境里的访问异常时,我做得最多的一个动作不是急着抓包,而是先看一眼防火墙设备上的连接跟踪表:这条连接到底在不在表里?状态是 NEW 还是 ESTABLISHED?有没有回包方向的记录?这个习惯帮我省下过大量…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

2026/10/11 0:02:13

Python调用Gemini Structured Outputs实现工单路由门禁

客服工单最怕的不是模型“答错一句话”,而是它给出一段看起来合理的说明,程序却从中猜错优先级。通俗做法是:要求模型只交 JSON(JavaScript Object Notation,轻量数据格式),再让代码验证它。Gem…

2026/10/11 0:02:13

Spring Boot超市进销存系统毕设实战:从需求拆解到答辩通关

最近带的一个学生项目组里,有A同学跑来问我:选什么毕设题目最稳妥,既能让评审老师觉得工作量够,又不会在答辩时被问到语无伦次。我第一反应就是推荐基于Spring Boot的超市仓库管理系统——也就是超市进销存系统。这个题目乍一看平…

2026/10/11 0:02:13

Flutter StatefulWidget 生命周期核心解析

很多刚开始接触 Flutter 的朋友,在看完一堆“Hello World”和基础组件之后,大概率都会撞上同一堵墙:StatefulWidget 里那堆 initState、build、dispose 方法,到底什么时候被调用?为什么顺序是那样?在里面到…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑