发布时间:2026/9/7 7:14:00
FunASR 语音识别实战:3 步转写会议录音并自动标注说话人 FunASR 语音识别实战3 步转写会议录音并自动标注说话人【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR当你拿到一段一小时的会议录音想要的往往不是转成文字而是谁在什么时间说了什么。FunASR 就是为此准备的开源语音识别工具包它把 ASR、语音活动检测VAD、标点、说话人分离等多个模型打包成一次调用产出带说话人编号和时间戳的转写结果而不是一坨无标点长文本。3 分钟跑通本地语音识别CPU 机器安装两条命令即可GPU 机器请先装好匹配的 PyTorchpip install torch torchaudio pip install funasr然后新建脚本粘贴这段代码。这里用 SenseVoiceSmall 做识别配 FSMN-VAD 切段、cam 做说话人区分from funasr import AutoModel from funasr.utils.postprocess_utils import rich_transcription_postprocess model AutoModel(modeliic/SenseVoiceSmall, vad_modelfsmn-vad, spk_modelcam, devicecpu) result model.generate(inputmeeting.wav) for seg in result[0][sentence_info]: print(f[{seg[start]/1000:.1f}s] Speaker {seg[spk]}: f{rich_transcription_postprocess(seg[sentence])})把meeting.wav换成你的音频路径运行后每行输出形如[0.6s] Speaker 0: 欢迎大家来体验达摩院推出的语音识别模型即时间 说话人 文本。首次运行会自动从模型仓库下载模型并缓存到本地第二次运行就快了。一张图看懂整体结构FunASR 把整条链路分成四个部分从 docs/images/funasr_overview.png 这张总览图可以对应上Model zooParaformer、SenseVoice、FSMN-VAD、CT-Transformer 等预训练模型funasr library核心库每个任务都有成对的 trainer/infer 脚本还有export_model.py负责模型导出Runtime把模型导出为 LibTorch / ONNX / TensorRT供 C 部署Service通过 gRPC、websocket、Triton 对外提供服务。写 Python 脚本时你主要打交道的就是中间的 funasr 库入口在 funasr/auto/要做 C 服务化部署相关代码和文档在 runtime/。说话人标签和时间戳是怎么来的上一步输出里的Speaker 0不是事后补的流水线先用 FSMN-VAD 把长音频切成有语音的片段cam 从每个片段提取声纹特征并聚类归组再由 SenseVoiceSmall 逐段转写每句的起止毫秒数一并写入sentence_info这也是字幕和检索功能的数据基础。如果你不需要VAD 声纹 ASR组合而是想让一个模型端到端地同时输出内容和说话人FunASR 里也有 Speaker-Attributed ASR 实现funasr/models/sa_asr/结构如下图左侧 AsrDecoder 预测文本 token右侧 SpeakerDecoder 预测说话人 仓库目录地图新手从哪找起funasr/ — 主库。models/下每个子目录就是一个模型实现paraformer、sense_voice、fsmn_vad_streaming 等datasets/、train_utils/用于训练examples/ — 可运行示例。colab/里有浏览器版 notebook不用装环境也能体验docs/ — 安装、模型选型、故障排查文档tests/— 各流水线冒烟测试环境装完可以先跑一遍验证。怎么选模型热词在哪配具体选型建议直接看 docs/model_selection.md常用的是三个SenseVoiceSmall中/英/日/韩/粤多语言附带情绪和音频事件标签CPU 可跑适合当默认选择Paraformer专注普通话支持字级时间戳和热词Fun-ASR-Nano基于 LLM 的 ASR对专名、上下文和方言口音更稳需要 GPU。录音里专名多公司名、产品名时可以在generate里传带权重的热词字符串例如hotword关键词 20表示给关键词这个词加 20 分权重。C 运行时那边也有一份现成的 runtime/websocket/hotwords.txt每行一个词 权重可以直接抄格式。把识别搬出脚本CLI 和 OpenAI 兼容 API不想写 Python 的话装完直接敲命令行即可funasr audio.wav -f srt -o ./subs生成字幕文件--spk开启说话人分离--timestamps输出字级时间戳完整参数表在 docs/cli.md。要接入 LangChain、Dify 这类应用看 examples/openai_api/里面是一个完整的 OpenAI 兼容服务含 Docker 部署用funasr-server --device cuda启动后现有 OpenAI 客户端把 base_url 指到localhost:8000就能调识别接口。想再深入一步的话model_zoo/目录列出了全部可用预训练模型及其对应文档按场景挑一个看下去就行。【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/9/7 7:14:00

3 条命令完成电子书转有声书:ebook2audiobook 上手

3 条命令完成电子书转有声书:ebook2audiobook 上手 【免费下载链接】ebook2audiobook Generate audiobooks from e-books, voice cloning & 1158 languages! 项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook 每天通勤 40 分钟&#x…

2026/9/7 7:14:00

Android 3D音乐播放器:基于OpenGL ES的实时频谱可视化实战

简介:面向Android开发者的3D音乐播放器完整开源项目,聚焦OpenGL ES技术实现炫酷动态视觉特效,适合对图形渲染与音乐应用结合感兴趣的初中级程序员学习。压缩包共329个文件,仅816KB,以png界面素材、xml布局配置、java核…

2026/9/7 10:24:20

JavaWeb课程设计实战:学生管理系统从Servlet到JSP全流程解析

简介:这是一份面向Java Web初学者的学生管理系统课程设计项目,基于MVC模式实现,涵盖登录验证、背景轮播、学生信息的增删改查与按学号查询等核心功能,适合作为毕业设计或实训参考。资源包共35个文件,以9个Java源码为核…

2026/9/7 10:24:20

pandas全表多关键词筛选实战:str.contains与正则表达式高效实现

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/7 10:24:20

LC滤波电源闭环稳定性解析:从相位裕度到补偿网络设计

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/7 0:47:43

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/7 0:14:19

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/7 0:14:17

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/7 0:03:36

基于YOLOv8和PyQt5的麦穗稻穗检测识别系统设计与实现

这次我们来看一个把目标检测算法和桌面端工具结合得很典型的项目:基于 YOLOv8 PyQt5 的麦穗稻穗检测识别系统。这个项目本身不是新概念,但它的价值在于落地形态很完整。YOLOv8 负责核心的麦穗稻穗目标检测,PyQt5 负责提供可视化的桌面交互界…

2026/9/7 0:03:36

UL 1642锂电池安全标准全解析:测试项目、认证流程与避坑指南

简介:UL 1642是锂电池安全领域的重要规范,本中文版资源适合锂电池制造商、检测机构工程师及产品认证相关人员阅读,用于理解电池在设计与制造层面的安全要求、测试方法与合规要点。资源共1个PDF文件,压缩包大小834KB,便…

2026/9/7 0:03:36

BS EN 13814-1-2019游乐设施安全标准:设计与制造核心要点解析

简介:BS EN 13814-1:2019是英国采纳欧洲标准EN 13814-1:2019的正式版本,由BSI标准出版,重点规定游乐设施和游乐设备在设计与制造环节的安全准则,与BS EN 13814-2:2019、BS EN 13814-3:2019共同取代旧版BS EN 13814:2004。该标准面…

2026/9/6 11:40:10

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/6 19:33:50

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/6 10:19:40

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…