FunASR ModelScope 模型仓库全解析:预训练模型清单、选型与调用指南

发布时间:2026/9/13 17:37:56

FunASR ModelScope 模型仓库全解析:预训练模型清单、选型与调用指南 FunASR ModelScope 模型仓库全解析预训练模型清单、选型与调用指南【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR本篇文章基于 FunASR 开源语音工具包仓库中的模型清单文档model_zoo/modelscope_models_zh.md系统梳理在 ModelScope 平台发布的预训练模型族涵盖语音识别Paraformer、UniASR、Conformer、多说话人识别MFCCA、VAD 端点检测、标点恢复、说话人确认/日志、时间戳预测与逆文本正则化ITN等全链路组件并给出模型许可边界、使用入口和源码级的加载调用细节。读完本文你将能按任务准确选型、理解不同模型族的参数规模与实时性边界并掌握通过 FunASR Python SDK 与模型别名机制正确加载这些模型的方法。一、模型许可协议工具包与模型权重是两套许可FunASR 工具包本体采用 MIT 软件许可见 LICENSE但模型权重的许可需要单独核对。使用或再分发任何 checkpoint 之前务必检查该模型卡、许可文件以及具体的 revision 版本。仓库根目录的 MODEL_LICENSEFunASR 模型开源协议 1.1 版仅适用于发布条款明确声明采用它的模型不能套用于模型清单中的全部条目。该协议规定在遵守协议前提下可自由使用、复制、修改和分享模型权重及其微调衍生品但必须注明出处与作者信息并保留相关模型名称同时明确指出模型权重仅作为参考和学习用途使用或修改产生的风险由使用者自行承担。此外清单中部分条目属于第三方模型。例如 OpenMOSS 发布的 MOSS-Transcribe-Diarize保留原作者归属和各自的模型许可Apache-2.0不是 FunASR 团队训练或发布的权重。社区层面也强调出现在模型清单中不代表该模型可被所有服务、导出工具或硬件后端直接使用模型仓库说明 明确要求先分别确定模型、权重格式和运行时。二、模型用法三份入口文档与一条 MOSS 专用路径在挑选具体模型之前官方文档建议按以下顺序建立整体认知入口路径作用模型选型docs/model_selection_zh.md按需求场景中文生产 ASR、多语种快速转写、流式、LLM 类 ASR 等给出决策表Python SDK 入门docs/tutorial/README_zh.md完成第一次转写、理解参数与结果、组合 VAD/标点/说话人组件部署矩阵docs/deployment_matrix_zh.md从 Python API 到 OpenAI 兼容服务、Runtime WebSocket、vLLM 等运行路径选型对于 MOSS-Transcribe-Diarize必须使用专门的适配器与服务指南docs/moss_transcribe_diarize_zh.md不要直接套用其他模型的流水线——它是 OpenMOSS 第三方模型原生联合完成转写与说话人分离拥有独立的输出结构和依赖路径不需要外部 VAD 或说话人模型也不是已知人物身份识别输出的是录音内的匿名说话人标签。三、模型仓库全景按任务族分类的预训练模型清单以下清单对应 ModelScope 平台modelscope.cn任务类型 auto-speech-recognition上发布的模型模型与数据集的详细信息可在平台按模型 ID 搜索获取。注意同一模型族内非实时/实时Offline/Online决定推理契约差异离线模型与流式模型不能混用。3.1 语音识别模型Paraformer 系列Paraformer 是非自回归NAT语音识别模型覆盖中英双语与中文学术场景从 5.2M 参数的 tiny 到 220M 参数的 large 一应俱全。模型语言训练数据词典大小参数量非实时/实时备注Paraformer-large中文和英文阿里巴巴语音数据60000 小时8404220M非实时输入 wav 文件持续时间不超过 20 秒Paraformer-large 长音频版本中文和英文阿里巴巴语音数据60000 小时8404220M非实时能够处理任意长度的输入 wav 文件Paraformer-large-en 长音频版本英文阿里巴巴语音数据50000 小时10020220M非实时能够处理任意长度的输入 wav 文件Paraformer-large-Spk中文和英文阿里巴巴语音数据60000 小时8404220M非实时在长音频功能基础上添加说话人识别功能Paraformer-large 热词中文和英文阿里巴巴语音数据60000 小时8404220M非实时基于激励增强的热词定制支持可提高热词召回率和准确率输入 wav 不超过 20 秒Paraformer中文和英文阿里巴巴语音数据50000 小时835868M离线输入 wav 文件持续时间不超过 20 秒Paraformer 实时中文和英文阿里巴巴语音数据50000 小时840468M实时能够处理流式输入Paraformer-large 实时中文和英文阿里巴巴语音数据60000 小时8404220M实时能够处理流式输入Paraformer-tiny中文阿里巴巴语音数据200 小时5445.2M非实时轻量级 Paraformer 模型支持普通话命令词识别Paraformer-aishell中文AISHELL178 小时423443M非实时学术模型ParaformerBert-aishell中文AISHELL178 小时423443M非实时学术模型Paraformer-aishell2中文AISHELL-21000 小时521264M非实时学术模型ParaformerBert-aishell2中文AISHELL-21000 小时521264M非实时学术模型Paraformer 系列需要区分组合流水线与单个 checkpoint清单中带 VAD/标点/说话人组合能力的模型如 large 长音频版、large-Spk描述的是组合流水线与 SDK 别名paraformer-zh对应的权重不是同一产物。需要显式组合时应按 SDK 文档 分别设置vad_model、punc_model和spk_model不要把整个配套组件视为一个可互换的 ASR checkpoint。3.2 语音识别模型UniASR 系列UniASR 是流式离线一体化2-pass模型同一模型兼顾流式输入与离线精识别覆盖中英、日、韩、俄、粤语及东南亚、欧洲、中东等多个语种。模型语言训练数据词典大小参数量非实时/实时备注UniASR中文和英文阿里巴巴语音数据60000 小时8358100M实时流式离线一体化模型UniASR-large中文和英文阿里巴巴语音数据60000 小时8358220M非实时流式离线一体化模型UniASR English英文阿里巴巴语音数据10000 小时108095M实时流式离线一体化模型UniASR Russian俄语阿里巴巴语音数据5000 小时166495M实时流式离线一体化模型UniASR Japanese日语阿里巴巴语音数据5000 小时597795M实时流式离线一体化模型UniASR Korean韩语阿里巴巴语音数据2000 小时640095M实时流式离线一体化模型UniASR Cantonese (CHS)粤语简体中文阿里巴巴语音数据5000 小时146895M实时流式离线一体化模型UniASR Indonesian印尼语阿里巴巴语音数据1000 小时106795M实时流式离线一体化模型UniASR Vietnamese越南语阿里巴巴语音数据1000 小时100195M实时流式离线一体化模型UniASR Spanish西班牙语阿里巴巴语音数据1000 小时344595M实时流式离线一体化模型UniASR Portuguese葡萄牙语阿里巴巴语音数据1000 小时161795M实时流式离线一体化模型UniASR French法语阿里巴巴语音数据1000 小时347295M实时流式离线一体化模型UniASR German德语阿里巴巴语音数据1000 小时369095M实时流式离线一体化模型UniASR Persian波斯语阿里巴巴语音数据1000 小时125795M实时流式离线一体化模型UniASR Burmese缅甸语阿里巴巴语音数据1000 小时69695M实时流式离线一体化模型UniASR Hebrew希伯来语阿里巴巴语音数据1000 小时108595M实时流式离线一体化模型UniASR Urdu乌尔都语阿里巴巴语音数据1000 小时87795M实时流式离线一体化模型UniASR Turkish土耳其语阿里巴巴语音数据1000 小时158295M实时流式离线一体化模型3.3 语音识别模型Conformer 系列Conformer 以 AISHELL 等学术数据集训练为主适合研究对比与学术实验模型语言训练数据词典大小参数量非实时/实时备注Conformer中文AISHELL178 小时423444M非实时输入 wav 不超过 20 秒Conformer中文AISHELL-21000 小时521244M非实时输入 wav 不超过 20 秒Conformer英文阿里巴巴语音数据10000 小时4199220M非实时输入 wav 不超过 20 秒3.4 多说话人语音识别模型MFCCA模型语言训练数据词典大小参数量非实时/实时备注MFCCA中文AliMeeting、AISHELL-4、Simudata917 小时495045M非实时输入音频不超过 20 秒通道数不超过 8 通道MFCCA 的模型实现位于 funasr/models/mfcca从源码结构看属于多通道、多说话人语音识别路线使用时需遵守单通道单声道之外的多通道输入边界。3.5 语音端点检测模型VADVAD 负责定位语音区间本身不做转写是长音频流水线的前置组件模型训练数据模型参数采样率备注FSMN-VAD阿里巴巴语音数据5000 小时0.4M16000—FSMN-VAD阿里巴巴语音数据5000 小时0.4M8000—16 kHz 与 8 kHz 两个版本对应不同采样率输入。VAD 组件的使用示例见 examples/industrial_data_pretraining/fsmn_vad_streaming其返回的value为相对于录音起点的[start_ms, end_ms]语音区间列表。3.6 标点恢复模型Punctuation模型语言训练数据模型参数词典大小非实时/实时备注CT-Transformer-Large中文和英文Alibaba Text Data100M1.1G471067非实时支持中英文标点大模型CT-Transformer中文和英文Alibaba Text Data70M291M272727非实时支持中英文标点CT-Transformer-Realtime中文和英文Alibaba Text Data70M288M272727实时VAD 点实时标点标点恢复的实时版本面向流式场景在 VAD 切分点上实时输出标点。标点模型不生成声学时间戳这是它与时间戳预测模型的本质区别模型仓库组件说明。3.7 语言模型模型训练数据模型参数词典大小备注Transformer阿里巴巴语音数据57M8404—该语言模型LM与 Paraformer 系列词典大小8404一致可用于解码重打分等场景。3.8 说话人确认模型Speaker Verification模型训练数据模型参数说话人数备注XvectorCNCeleb1200 小时17.5M3465Xvector中文XvectorCallHome60 小时61M6135Xvector英文3.9 说话人日志模型Speaker Diarization模型训练数据模型参数备注SONDAliMeeting120 小时40.5M中文SONDCallHome60 小时12M英文3.10 第三方统一转写与说话人分离模型发布方模型参数备注MOSS-Transcribe-DiarizeOpenMOSS以官方模型卡为准第三方 Apache-2.0 模型单次非实时请求输出转写、时间戳和说话人标签FunASR 集成无需额外拼接 VAD 服务。参见部署指南3.11 时间戳预测模型模型语言训练数据模型参数备注TP-Aligner中文阿里巴巴语音数据50000 小时37.8M时间戳模型中文TP-Aligner 用于对已有文本做强制对齐以预测时间戳与语音识别是不同任务对齐需要对应的文本输入不等同于语音识别教程说明。3.12 逆文本正则化模型ITNITN 用于语音识别文本后处理将口语化输出恢复为适合展示的书面形式覆盖 11 种语言模型语言模型参数备注EnglishEN1.54MITN语音识别文本后处理RussianRU17.79MITN语音识别文本后处理JapaneseJA6.8MITN语音识别文本后处理KoreanKO1.28MITN语音识别文本后处理IndonesianID2.06MITN语音识别文本后处理VietnameseVI0.92MITN语音识别文本后处理TagalogTL0.65MITN语音识别文本后处理SpanishES1.32MITN语音识别文本后处理PortuguesePT1.28MITN语音识别文本后处理FrenchFR4.39MITN语音识别文本后处理GermanGE3.95MITN语音识别文本后处理ITN 的工程实现位于 fun_text_processing/inverse_text_normalization对应语种目录下包含完整的规则与测试数据如run_evaluate.py评估入口。四、源码视角模型别名映射与下载解析机制清单文档中的模型 ID 可以直接作为AutoModel(model完整模型ID, hubms)的参数也可以使用 SDK 内置的短别名。别名映射定义在 funasr/download/name_maps_from_hub.pySDK 别名指向的 ModelScope 模型hubms用途paraformeriic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-pytorch中文离线转写largeparaformer-zhiic/speech_seaco_paraformer_large_asr_nat-zh-cn-16k-common-vocab8404-pytorch中文离线转写SeACo 热词版paraformer-eniic/speech_paraformer-large-vad-punc_asr_nat-en-16k-common-vocab10020英文离线转写paraformer-zh-streamingiic/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-online带会话 cache 的分块流式推理fsmn-vadiic/speech_fsmn_vad_zh-cn-16k-common-pytorch语音活动检测ct-punciic/punc_ct-transformer_cn-en-common-vocab471067-large标点恢复largect-punc-ciic/punc_ct-transformer_zh-cn-common-vocab272727-pytorch标点恢复fa-zhiic/speech_timestamp_prediction-v1-16k-offline中文时间戳预测camiic/speech_campplus_sv_zh-cn_16k-common说话人向量值得注意的细节paraformer-zh别名在 ModelScope 上映射到SeACo Paraformer热词增强版而不是基础 Paraformer-large。这意味着通过该别名加载的模型天然支持hotword参数空格分隔字符串其实现见 funasr/models/seaco_paraformer/model.py。别名机制只是便捷入口别名本身不是不可变的模型版本readme_zh.md生产环境应记录实际解析出的完整模型 ID 与 revision。模型下载与配置解析的核心实现在 funasr/download/download_model_from_hub.py流程可概括为别名解析hub参数决定走name_maps_ms默认ms/modelscope还是name_maps_hfHugging Facemodel名命中映射表时替换为完整模型 ID快照下载ModelScope 路径调用snapshot_download(model, revisionmodel_revision)默认 revision 为master并附带funasr三方标记的 user-agent本地已存在目录时还会尝试check_local_model_is_latest检查最新版本配置解析下载完成后读取模型目录中的configuration.json通过file_path_metas拼接各文件绝对路径或config.yaml自动补全model.pt权重、tokens.txt/tokens.json词表、am.mvn前端归一化统计、bpe.model等最终用 OmegaConf 合并得到完整实例化配置。一个最简调用示例来自 模型仓库说明from funasr import AutoModel model AutoModel(modelparaformer-zh, hubms, devicecpu) result model.generate(inputmeeting.wav) print(result[0][text])将meeting.wav替换为实际录音。首次执行会联网下载模型建议下载、预热和推理耗时分开记录。五、实战组合把清单中的组件拼成完整流水线模型清单的价值在于按需组合。以中文长音频 标点 说话人为例可参照 Python SDK 教程 组合 Paraformer、FSMN-VAD、CT-Transformer 与 CAMpipeline AutoModel( modelparaformer-zh, vad_modelfsmn-vad, punc_modelct-punc, spk_modelcam, spk_modepunc_segment, vad_kwargs{max_single_segment_time: 30000}, devicecpu, disable_updateTrue, trust_remote_codeFalse, ) segmented_results pipeline.generate( inputaudio, batch_size_s60, batch_size_threshold_s30, sentence_timestampTrue, return_spk_resTrue, ) for item in segmented_results: print(item.get(text, )) for sentence in item.get(sentence_info, []): print(sentence.get(start), sentence.get(end), sentence.get(spk), sentence.get(text, ))关键参数说明max_single_segment_time单位为毫秒两个 batch 时长参数batch_size_s、batch_size_threshold_s单位为秒sentence_info中的start/end单位为毫秒spk是本次结果内的匿名聚类标签不是已验证身份也不是跨录音稳定 IDpython_api_zh.md说话人标签须从每条输入的sentence_info中读取不要从外层结果列表直接读取spk。六、选型与上线要点结合 模型选择指南 与 部署矩阵针对本文清单中的模型族给出落地建议中文生产 ASR优先 Paraformer 系列非自回归、成熟稳定需要热词偏置时选 SeACo 版本paraformer-zh别名需要字级时间戳时确认 checkpoint 提供timestamp字段流式实时场景选 Paraformer 实时版或 UniASR 系列流式模型需要维护调用方持有的cache{}字典并按块传入is_finalTrue见 流式实现 与 示例长音频 说话人标签Paraformer-large 长音频版 / Spk 版或直接使用 MOSS-Transcribe-Diarize一次请求返回转写、时间戳与匿名说话人多语种覆盖UniASR 系列覆盖 17 语种SenseVoiceSmall 可另行参考不在本文清单内见模型仓库学术实验AISHELL / AISHELL-2 上训练的 Paraformer、Conformer、ParaformerBert 变体后处理链路CT-Transformer 标点、TP-Aligner 时间戳、ITN 逆文本正则化按需串联。上线前务必记录模型名、模型版本/revision、FunASR 版本、设备与推理选项并准备 20-50 条覆盖短音频、长会议、静音、噪声、多人重叠的评测集不要只用一个干净 demo 文件选型。模型清单保留部分历史模型新部署前应核查对应模型卡与许可。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
延伸阅读

更多相关文章

2026/9/13 17:37:56

STM32CubeProgrammer:嵌入式AI编程的硬件可信锚点

1. 为什么STM32CubeProgrammer不是“装个软件”那么简单——嵌入式AI编程链路上的关键卡点在嵌入式软件AI编程的实操现场,我见过太多人卡在第一步:STM32CubeProgrammer装不上、连不了设备、烧不进固件。他们以为这只是个“下载工具”,随手点开…

2026/9/13 18:27:59

量化高频交易 FPGA 还是 GPU:三组实测+三年 TCO 账本

量化高频交易 FPGA 还是 GPU:三组实测三年 TCO 账本 【免费下载链接】gs-quant Python toolkit for quantitative finance 项目地址: https://gitcode.com/GitHub_Trending/gs/gs-quant 在高频交易里,延迟就是盈亏:比对手快 1 微秒可能…

2026/9/13 18:27:59

ClaudeCode Insights:智能代码分析与个性化编程助手

1. ClaudeCode Insights命令概述ClaudeCode的Insights命令是一项革命性的代码分析功能,它能够深入理解开发者的编程习惯、思维模式和代码质量,提供超越传统静态分析工具的智能建议。这个功能的核心在于其独特的上下文感知能力,能够结合项目历…

2026/9/13 18:27:59

Huly 如何叠加 billing 与 payment 服务并配置 Stripe 沙箱

Huly 如何叠加 billing 与 payment 服务并配置 Stripe 沙箱 【免费下载链接】platform Huly — All-in-One Project Management Platform (alternative to Linear, Jira, Slack, Notion, Motion) 项目地址: https://gitcode.com/GitHub_Trending/platform80/platform Hu…

2026/9/13 0:01:16

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/13 0:01:16

拯救者Y7000黑屏故障排查与维修实战指南

1. 项目概述:一台黑屏的拯救者Y7000,到底卡在哪一步? 联想拯救者Y7000系列笔记本,从2018年第一代搭载i5-8300H开始,到后来的i7-9750H、i7-10750H、i5-11400H,再到2023年款的R7-7840HS,它始终是学…

2026/9/12 6:29:36

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/12 14:32:17

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/13 11:18:28

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码