发布时间:2026/8/22 21:56:09
video-analyzer 视频分析指南:一条命令把会议录像变成结构化文字摘要 video-analyzer 视频分析指南一条命令把会议录像变成结构化文字摘要【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer收件箱里压着一段两小时的会议录像下班前你得知道里面定了什么、谁领了什么活。手动拉进度条不是办法video-analyzer 就是干这个的它先用 Whisper 把音频转成文字再用视觉大模型挑出关键帧逐帧描述最后把两部分合成一份写进 JSON 的视频摘要全程可以本地离线跑完视频不出机器。离线跑通第一条命令这节解决装什么、敲哪几条命令能出结果的问题。依赖只有两个Python 3.11 以上和 FFmpeg抽音频用Linux 下sudo apt install ffmpegmacOS 用 brewWindows 用 choco 都行。如果你打算在本地跑视觉模型机器还需要至少 16GB 内存建议 32GB、12GB 显存的 GPU或 32GB 统一内存的 Apple 芯片走云端 API 的话这条可以忽略。克隆仓库并装进虚拟环境git clone https://gitcode.com/gh_mirrors/vi/video-analyzer cd video-analyzer python3 -m venv .venv source .venv/bin/activate # Windows: .venv\Scripts\activate pip install .默认走本地 Ollama先把视觉模型拉下来并启动服务ollama pull llama3.2-vision ollama serve然后正式分析一条命令就够video-analyzer meeting.mp4跑完之后output 目录里有什么这节解决结果长什么样、该怎么读的问题。所有结果落在output/analysis.json里四个区块各管一事metadata这次用了什么模型、抽了多少帧frames_extracted、转写是否成功transcription_successful、检测到的音频语言transcript全文加上带start/end时间戳的分段找谁在什么时候说了什么看这里frame_analyses每个关键帧一份描述。默认提示词会按场景 / 动作 / 新出现的元素 / 与上一帧的衔接四段来写而且每一帧的分析都带着前面所有帧的记录所以描述是连贯的不是一堆孤立画面video_description最终合成的整段视频摘要。仓库里有一份完整样例 docs/sample_analysis.json最终描述大概是这样开头的The video begins with a person with long blonde hair, wearing a pink t-shirt and yellow shorts, standing in front of a black plastic tub or container on wheels...注意跑完后output/下的frames/目录和audio.wav会被自动清理只留 JSON想留帧图片就加--keep-frames。上图是 docs/DESIGN.md 里的三阶段流程视频先经过 Transcribe 和 Frame Selection当前帧加上此前所有帧的描述一起送给 LLM Server 做 Describe Frames最后 Describe Video 把全部帧描述和转写合成整段摘要过程产物都写进 analysis.json。️ 长视频别硬跑五个最影响结果的开关这节解决视频变长、需求变具体时哪些参数值得调的问题。参数作用典型用法--duration只处理前 N 秒先看开头十分钟--duration 600--max-frames限制送进模型的帧数且是全片均匀采样不是只取前 N 帧控耗时--max-frames 50--whisper-model转写模型大小默认 medium环境吵换large赶时间换tiny--prompt给分析附加一个具体问题提取会议决策和待办--language固定转写语言自动检测不准时手动指定一段两小时的讲座想先试水质量这样调video-analyzer long_lecture.mp4 \ --duration 600 \ --max-frames 50 \ --whisper-model large \ --prompt 提取教学步骤和关键操作要点 \ --keep-frames不想每次敲参数可以写进config/config.json优先级是命令行 用户配置 默认值config/default_config.json。其中控制关键帧的frames段长这样frames: { per_minute: 60, analysis_threshold: 10.0, min_difference: 5.0, max_count: 30 }per_minute按视频时长估算目标帧数analysis_threshold/min_difference是帧间灰度差值的打分门槛变化够大才算关键帧max_count是最终上限。所有字段的完整说明在 docs/USAGES.md。跑到一半断了续跑和换云端这节解决本地任务中断或太慢时怎么办的问题。流程分三阶段抽帧转写 → 逐帧分析 → 合成描述用--start-stage可以从中间接上阶段 1 跑完崩了就--start-stage 2直接从逐帧分析开始只想换个提示词重跑最终摘要--start-stage 3即可。本地显存吃紧时可以换成任意 OpenAI 兼容接口video-analyzer meeting.mp4 \ --client openai_api \ --api-key your-key \ --api-url https://openrouter.ai/api/v1 \ --model meta-llama/llama-3.2-11b-vision-instruct:freeOpenRouter 上有免费的 Llama 3.2 11B 视觉模型模型名加:free后缀。转写本身也可以丢给 GPU--device cuda。让输出更符合你的口味调提示词这节解决默认的描述风格不贴你的业务场景的问题。驱动流程的是两个提示词文件video_analyzer/prompts/frame_analysis/frame_analysis.txt逐帧记录要求现在时、只写看到的、不脑补和frame_analysis/describe.txt最终合成。想换风格仓库里有个现成的调优子包video-analyzer-tune思路是给几个你改好的理想输出让它自己找更好的提示词DSPy MIPROv2pip install video-analyzer-tune video-analyzer my_video.mp4 --keep-frames然后编辑output/analysis.json把video_description.response改成你心目中理想的最终描述必改顺手把几条frame_analyses[i].response也改成理想写法建议。再建一个training_data.json把每个改过的输出目录列进examples视频给得越多效果越好最后跑 tuner产出的提示词是新文件通过配置指向它即可主包不受影响。它看不见的部分这节说清楚边界免得你对着结果找 bug。关键帧是靠帧间差值选的所以 docs/DESIGN.md 明确列了几个盲区采样间隔之间发生的画面会漏掉快速切换的镜头可能只留一帧--max-frames均匀采样时也会跳过部分变化大的瞬间。换句话说它擅长讲清楚视频里发生了什么不适合做精确到帧的事件检测。音频质量差到置信度不达标时转写会被直接跳过描述只基于画面。输出就是单个 analysis.json没有检索、切片导出这类后处理。仓库里还有两个可选子项目带网页界面的video-analyzer-ui以及上面提到的video-analyzer-tune。下一步拿一段 5 分钟以内的短视频用默认参数跑一遍读一遍analysis.json再决定调哪些开关。完整参数表和配置说明见 docs/USAGES.md。【免费下载链接】video-analyzerAnalyze videos using LLMs, Computer Vision and Automatic Speech Recognition项目地址: https://gitcode.com/gh_mirrors/vi/video-analyzer创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

2026/8/22 21:51:08

Jasmine Comic:三步上手的跨平台漫画阅读器

Jasmine Comic:三步上手的跨平台漫画阅读器 【免费下载链接】jasmine A comic browser,support Android / iOS / MacOS / Windows / Linux. 项目地址: https://gitcode.com/gh_mirrors/jas/jasmine Jasmine Comic 是一款基于 Flutter 的跨平台漫…

2026/8/22 23:06:13

焊接空洞率检测配套真空炉实操教程与要点解析

关于生产晶闸管可控硅模块的电力电子企业采购真空共晶炉的相关技术和应用,近年来受到了业界的广泛关注。 对于焊接空洞率检测配套真空炉这一技术热点,业内专家提出了多种解决方案。 光伏功率器件真空共晶炉在现代电力电子企业中的应用 随着科技的飞速发展…

2026/8/22 23:06:13

2010-2025年数字经济政策与企业数据资产化【论文复现】

数字经济政策与企业数据资产化:大数据综合试验区准自然实验的全套复现数据(2010—2025) 一、研究背景与问题 数据作为继土地、劳动力、资本、技术之后的第五大生产要素,其资产化进程正在成为企业数字化转型的关键节点。然而&…

2026/8/22 23:06:13

AI率太高如何降?2026年DeepSeek全套降AI率指令+工具亲测指南

看着知网AIGC检测报告上飘红的数字,AI率怎么压都下不去,截稿日就在眼前,我急得连饭都没心思吃。为了帮大家搞定这个挠头的降AI难题,我花了半个月把市面上能找到的大模型降重指令、降AI工具挨个试了个遍。今天就把亲测有效的方案分…

2026/8/22 23:06:13

2026年选智慧园区公司,必看这3个靠谱筛选标准

做智慧园区落地5年,见过太多客户踩坑:花大价钱买了全功能方案,落地适配不了旧硬件,要么过不了合规检查,用半年就出问题。今天结合我踩过的坑,拆解2026年选服务商的3个核心标准,全是实操经验&…

2026/8/22 23:06:13

企业AI应用定制中的转人工交接:上下文为何接不上

客服平台上,一位用户在智能体这里没能解决问题,被转给了人工坐席。坐席接起对话,屏幕上却看不到用户刚才说了什么、智能体已经查过什么、卡在了哪一步,只能请用户把问题从头再讲一遍。用户的不满从没解决问题,变成了被…

2026/8/21 13:13:49

工业通信系统底层逻辑:04 反射——高频能量撞墙之后会发生什么?

第四篇:反射——高频能量撞墙之后会发生什么? —— 你以为信号已经过去了,其实它正在回来打你 老Q的现场笔记 第五季,我们正式进入工业神经系统层。这里不再是单个设备的战斗,而是整个工厂“经脉”层面的秩序之战。从这一篇开始,你将第一次看清:看似简单的信号传播,背…

2026/8/21 20:14:07

工业传感器与变送器详解:序章 从物理世界到工业数据

序章 从物理世界到工业数据 ——重新认识工业传感器与变送器 工业自动化系统正变得日益复杂。今天的工业现场早已不是简单的控制回路,而是由多层技术共同构成的立体体系:PLC、DCS、SCADA、MES、工业互联网、边缘计算与人工智能。控制系统可以执行复杂算法,工业网络可以实现…

2026/8/21 15:40:01

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/21 15:40:01

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/22 1:39:53

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…