发布时间:2026/8/6 17:40:34
[1214]基于Python实现视频去重 文章目录videohash2️ 安装 基本用法 比较视频如何判断相似 进阶用法⚠️ 使用限制 与另一个分支的区别基于Python实现视频去重基本原理实现方法其它视频去重codevideohash2https://github.com/akamhy/videohashhttps://github.com/Demmenie/videohash2在开始之前请确保你的电脑已经安装了FFmpeg这是它正常工作的基础。️ 安装最推荐的方式是通过 pip 从 PyPI 安装pipinstallvideohash2如果安装失败可以尝试加上--prefer-binary选项。 基本用法videohash2的核心是VideoHash类。它可以处理本地视频文件路径或网络URL比如YouTube链接。fromvideohash2importVideoHash# 1. 从URL创建哈希video_hash_1VideoHash(urlhttps://example.com/video.mp4)# 2. 从本地文件路径创建哈希video_hash_2VideoHash(path/path/to/your/local/video.mp4) 比较视频如何判断相似这是它的核心功能。你可以计算两个视频哈希值的“距离”来判断相似度距离越小视频越相似。# 假设 video_hash_1 和 video_hash_2 已经创建好# 方法一计算“海明距离” (Hamming Distance)# 计算两个哈希值有多少位不同结果为整数0表示完全一致distancevideo_hash_1-video_hash_2print(f视频间的距离是:{distance})# 方法二使用内置的相似度判断# 返回 True 或 False内部使用了一个默认的阈值来判断是否相似is_similarvideo_hash_1.is_similar(video_hash_2)print(f两个视频是否相似:{is_similar})# 你还可以直接用 判断是否完全一致is_identical(video_hash_1video_hash_2)print(f两个视频是否完全一致:{is_identical}) 进阶用法调整采样帧率通过frame_interval参数控制每秒提取多少帧数值越大计算越精确但耗时也更长。默认是每秒1帧。# 每5秒提取1帧 (0.2 fps)video_hashVideoHash(pathvideo.mp4,frame_interval0.2)# 每秒提取5帧 (5 fps)video_hashVideoHash(pathvideo.mp4,frame_interval5)管理临时文件VideoHash在计算过程中会下载视频或创建临时文件可以通过storage_path指定存放目录防止撑爆系统临时文件夹。video_hashVideoHash(url...,storage_path/my/big/drive/video_cache)# 处理完后可以手动调用删除临时文件video_hash.delete_storage_path()⚠️ 使用限制这个工具的设计目标并不是视频指纹识别所以有一些场景它不适用它不能判断一个视频是否是另一个视频的一部分。如果视频被反转播放或旋转了超过10度哈希值可能会发生较大变化导致无法识别为相似视频。 与另一个分支的区别搜索时你可能还会看到一个叫videohash(不带2) 的库它是videohash2的前身。videohash2是最新版修复了旧版的一些问题建议直接使用videohash2。基于Python实现视频去重基本原理一款基于Python语言的视频去重复程序它可以根据视频的特征参数将重复的视频剔除以减少视频的存储空间。它的基本原理是首先利用Python语言对视频文件进行解析提取视频的特征参数如帧率、码率等然后根据特征参数生成视频的哈希值最后将每个视频的哈希值进行对比如果哈希值相同则表示视频内容相同可以将其中一个视频剔除以节省存储空间。实现方法基于Python实现视频去重小工具需要使用Python语言的一些第三方库如OpenCV、PIL等。实现的基本步骤如下1、首先使用OpenCV库对视频文件进行解析提取视频的特征参数2、然后使用PIL库将视频的每一帧转换为灰度图片计算每一帧图片的哈希值3、最后将每个视频的哈希值进行对比如果哈希值相同则表示视频内容相同可以将其中一个视频剔除。示例代码import cv2 from PIL import Image # 读取视频文件 video_file video.mp4 cap cv2.VideoCapture(video_file) # 提取视频的特征参数 frame_rate cap.get(cv2.CAP_PROP_FPS) frame_width cap.get(cv2.CAP_PROP_FRAME_WIDTH) frame_height cap.get(cv2.CAP_PROP_FRAME_HEIGHT) # 计算每一帧图片的哈希值 while True: # 读取每一帧图片 success, frame cap.read() if not success: break # 将图片转换为灰度图 gray_frame cv2.cvtColor(frame, cv2.COLOR_BGR2GRAY) # 计算图片的哈希值 image Image.fromarray(gray_frame) hash_value image.hash() # 将哈希值进行对比如果哈希值相同则表示视频内容相同 if hash_value other_hash_value: # 剔除重复视频 pass # 释放视频文件 cap.release()其它视频去重code同级目录下新建dup_video# -*- coding:utf-8 -*- import json import os import shutil import cv2 import imagehash from PIL import Image from loguru import logger from PySimpleGUI import popup_get_folder class VideoDuplicate(object): 返回整个视频的图片指纹列表 从1秒开始每3秒抽帧计算一张图像指纹 def __init__(self): self._over_length_video: list [] self._no_video: list [] def _video_hash(self, video_path) - list: param video_path - 视频绝对路径; hash_arr [] cap cv2.VideoCapture(video_path) ##打开视频文件 logger.info(f开始抽帧【{video_path}】) n_frames int(cap.get(cv2.CAP_PROP_FRAME_COUNT)) # 视频的帧数 logger.warning(f视频帧数:{n_frames}) fps cap.get(cv2.CAP_PROP_FPS) # 视频的帧率 logger.warning(f视频帧率:{fps}) dur n_frames / fps * 1000 # 视频大致总长度 cap_set 1000 logger.warning(f视频大约总长:{dur / 1000}) if dur // 1000 11: logger.error(f视频时长超出规定范围【6~10】;当前时长:【{dur // 1000}】;跳过该视频;) self._over_length_video.append(video_path) return [] while cap_set dur: # 从3秒开始每60秒抽帧计算图像指纹。总长度-3s是因为有的时候计算出来的长度不准。 cap.set(cv2.CAP_PROP_POS_MSEC, cap_set) logger.debug(f开始提取:【{cap_set // 1000}】/s的图片;) # 返回该时间点的图像(numpy数组)及读取是否成功 success, image_np cap.read() if success: img Image.fromarray(cv2.cvtColor(image_np, cv2.COLOR_BGR2RGB)) # 转成cv图像格式 h str(imagehash.dhash(img)) logger.success(f【{cap_set}/s图像指纹:【{h}】) hash_arr.append(h) # 图像指纹 else: logger.error(str(cap_set / 1000)) cap_set 1000 * 2 cap.release() # 释放视频 return hash_arr def start(self, base_dir): param base_dir - 主文件路径; data: list [] for video in os.listdir(base_dir): logger.debug(f- * 80) name, ext os.path.splitext(video) if ext not in (.mp4, .MP4): logger.error(f视频文件格式不符;【{video}】;执行跳过;) continue abs_video_path os.path.join(base_dir, video) video_hash_list self._video_hash(abs_video_path) if video_hash_list: data.append({video_abs_path: abs_video_path, hash: video_hash_list}) self._write_log(data) return data staticmethod def _write_log(data: list) - None: 视频哈希后的值写入日志文件 with open(flog.txt, w, encodingutf-8) as f: f.write(json.dumps(data)) def __call__(self, base_dir, *args, **kwargs): self.start(base_dir) logger.debug(f-----------------------------------开始比对关键帧差值感知余弦算法-----------------------------) with open(log.txt) as f: data json.loads(f.read()) for i in range(0, len(data) - 1): for j in range(i 1, len(data)): if data[i][hash] data[j][hash]: _, filename os.path.split(data[i][video_abs_path]) logger.error(f移动文件:【{filename}】) shutil.move( os.path.join(base_dir, filename), os.path.join(os.path.join(os.getcwd(), dup_video), filename) ) logger.warning(---------------------超长视频----------------------) for i in self._over_length_video: _, name os.path.split(i) logger.error(name) def main(): path popup_get_folder(请选择[视频去重]文件夹) v VideoDuplicate() v(path) if __name__ __main__: main()参考https://blog.csdn.net/weixin_44634704/article/details/128563576https://fiime.cn/blog/202363

相关新闻

2026/8/6 17:40:33

搭建drupal门户网站的详细步骤

1.安装 Apache,MySQL 和 PHP。在 Ubuntu 22.04 上安装 LAMP 资源包,请终端使用以下命令: sudo apt update sudo apt upgrade (1)安装Apache2 sudo apt-get install apache2 安装php组件 sudo apt-get install php l…

2026/8/6 17:40:33

linux系统下搭建dvwa靶场的详细过程

1.安装 Apache,MySQL 和 PHP。在 Ubuntu 22.04 上安装 LAMP 资源包,请终端使用以下命令: 更新系统 sudo apt update && sudo apt upgrade ##更新系统 安装Apache2 sudo apt-get install apache2 2.安装php组件 sudo apt-get …

2026/8/6 18:30:37

ComfyUI-VideoHelperSuite终极指南:3步快速构建AI视频工作流

ComfyUI-VideoHelperSuite终极指南:3步快速构建AI视频工作流 【免费下载链接】ComfyUI-VideoHelperSuite Nodes related to video workflows 项目地址: https://gitcode.com/gh_mirrors/co/ComfyUI-VideoHelperSuite ComfyUI-VideoHelperSuite是专为AI视频创…

2026/8/6 18:30:37

[STM32]CAN总线

一:CAN简介CAN(Controller Area Network)控制器局域网总线是由博世 (Bosch) 在 1980开发的一种传输速度快、易扩展、可靠性高的串行通信总线, 现在广泛用在汽车、工业控制、嵌入式设备。补充:CAN 虽然是差分通信&#…

2026/8/6 18:30:37

智能电话机器人,代替人工外呼,减少人工成本

智能电话机器人一旦投入使用,与电话销售员一天150到300通电话的工作效率为对比, 一台智能电话机器人系统至少可以顶替三个业务员,一天打1000通电话左右,也可以配置多台机器人同时工作,每天成千上万通电话不是问题。智能…

2026/8/6 18:30:37

从“选择困难”看消费决策的信息过载困局

最近看了一份关于ONDA微波溶脂技术的行业白皮书,注意到一个现象:信息过载正在导致消费者的“选择困难”。 《2026年医美用户白皮书》指出,“机构/平台太多,难以甄别”已成为消费者的第一大痛点。 为什么信息多了反而更难选了&…

2026/8/5 3:13:11

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/6 0:04:22

电力系统调度中的源荷不确定性建模与优化实践

1. 电力系统调度中的源荷不确定性挑战现代电力系统正面临前所未有的复杂性,其中源荷不确定性(Source-Load Uncertainty)已成为调度决策中最棘手的难题之一。我在参与某省级电网调度系统升级时,曾遇到风电预测误差导致日内调度计划…

2026/8/6 0:04:22

VGG-T3技术解析:3D重建速度的革命性突破

1. 项目概述:VGG-T3如何重新定义3D重建速度在计算机视觉领域,3D场景重建一直是个计算密集型任务。传统方法重建1000帧图像规模的场景往往需要数小时甚至更长时间,而英伟达最新发布的VGG-T3技术将这个时间压缩到了惊人的54秒。这个突破性进展来…

2026/8/6 0:04:22

深度解析旅游网站建设的意义及其对行业发展的深远影响与核心价值体现

在这个数字化浪潮席卷全球的今天,我们似乎已经忘记了,曾经有一段时间,人们想要去一个陌生的地方,只能靠在书桌前翻阅厚厚的旅游杂志,或者向刚从那里回来的朋友询问那些模糊不清的印象。那时候,“远方”是一个需要精打细算才能抵达的奢侈概念。而现在,只需要一部手机,轻…

2026/8/5 19:21:13

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/5 19:21:13

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/5 19:21:13

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…