毕设项目分享 深度学习语义分割实现弹幕防遮(源码分享)

发布时间:2026/9/25 8:47:11

毕设项目分享 深度学习语义分割实现弹幕防遮(源码分享) 文章目录0 简介1 课题背景2 技术原理和方法2.1基本原理2.2 技术选型和方法3 实例分割4 实现效果最后0 简介今天学长向大家分享一个毕业设计项目毕业设计 深度学习语义分割实现弹幕防遮(源码分享)项目分享见主页任意置顶文章1 课题背景弹幕是显示在视频上的评论可以以滚动、停留甚至更多动作特效方式出现在视频上是观看视频的人发送的简短评论。各大视频网站目前都有弹幕功能之家也于2020年5月正式上线视频弹幕功能受到了广大网友的喜爱大家在观看视频的同时也能通过弹幕进行互动。但密集的弹幕遮挡视频画面严重影响用户观看体验如何解决查阅了相关视频网站发现B站推出了一种蒙版弹幕技术可以让弹幕自动躲避人形区域达到弹幕不挡人的效果。B站视频弹幕不挡人的效果2 技术原理和方法2.1基本原理通过AI计算机视觉的技术对视频内容进行分析并将之前已经定义好的“视频主体内容”进行识别生成蒙版并分发给客户端后让客户端利用 CSS3 的特性进行渲染从而达成最终的效果。这样就形成了我们最终看到的“不挡脸”弹幕效果。实现方法就正如 PS 中的“蒙版“一样实心区域允许空白区域拒绝从而达到弹幕不挡人的效果。而技术的核心就在蒙版的生成上所以将这个功能称之为“蒙版弹幕”。2.2 技术选型和方法1、提取视频帧画面。对音视频的处理大家一般都会想到FFmpeg组件我们也是使用FFmpeg组件提取每帧的视频画面使用的是PyAV组件PyAV是FFmpeg封装能够灵活的编解码视频和音频并且支持Python常用的数据格式如numpy。2、识别视频帧画面人像区域。解决方案使用AI计算机视觉的实例分割技术可以识别视频帧画面的人像区域。3、AI框架目前市面上的AI框架主要以TensorFlowPyTorch最流行。TensorFlow出身豪门的工业界霸主由Google Brain团队研发。具有如下优点支持多种编程语言灵活的架构支持多GPU、分布式训练跨平台运行能力强自带TensorBoard组件能可视化计算图便于让用户实时监控观察训练过程官方文档非常详尽可查询资料众多社区庞大大量开发者活跃于此。PyTorch以动态图崛起的学术界宠儿是基于Torch并由Facebook强力支持的python端的开源深度学习库。具有如下优点简洁PyTorch在设计上更直观追求尽量少的封装建模过程透明代码易于理解易用应用十分灵活接口沿用Torch契合用户思维尽可能地让用户实现“所思即所得”不过多顾虑框架本身的束缚社区提供完整的文档和指南用户可以通过全面的教程完成从入门到进阶有疑问也可以在社区中获得各种及时交流的机会。我们的选择PyTorch。原因TensorFlow入门难度较大学习门槛高系统设计过于复杂而PyTorch入门难度低上手快而且提供的功能也非常易用预训练模型也非常多。4、实例分割技术实例分割Instance Segmentation是视觉经典四个任务中相对最难的一个它既具备语义分割Semantic Segmentation的特点需要做到像素层面上的分类也具备目标检测Object Detection的一部分特点即需要定位出不同实例即使它们是同一种类。3 实例分割简介实例分割已成为机器视觉研究中比较重要、复杂和具有挑战性的领域之一。为了预测对象类标签和特定于像素的对象实例掩码它对各种图像中出现的对象实例的不同类进行本地化。实例分割的目的主要是帮助机器人自动驾驶监视等。实例分割同时利用目标检测和语义分割的结果通过目标检测提供的目标最高置信度类别的索引将语义分割中目标对应的Mask抽取出来。实例分割顾名思义就是把一个类别里具体的一个个对象具体的一个个例子分割出来。Mask R-CNN算法本项目使用Mask R-CNN算法来进行图像实例分割。网络结构图Mask R-CNN一个相对简单和灵活的实例分割模型。该模型通过目标检测进行了实例分割同时生成了高质量的掩模。通常Faster R-CNN有一个用于识别物体边界框的分支。Mask R-CNN并行添加了一个对象蒙版预测分支作为改进。使用FPN主干的head架构如图所示。关键代码##利用不同的颜色为每个instance标注出mask根据box的坐标在instance的周围画上矩形 ##根据class_ids来寻找到对于的class_names。三个步骤中的任何一个都可以去掉比如把mask部分 ##去掉那就只剩下box和label。同时可以筛选出class_ids从而显示制定类别的instance显示,下面 ##这段就是用来显示人的其实也就把人的id选出来然后记录它们在输入ids中的相对位置从而得到 ##相对应的box与mask的准确顺序 def display_instances_person(image, boxes, masks, class_ids, class_names, scoresNone, title, figsize(16, 16), axNone): the funtion perform a role for displaying the persons who locate in the image boxes: [num_instance, (y1, x1, y2, x2, class_id)] in image coordinates. masks: [height, width, num_instances] class_ids: [num_instances] class_names: list of class names of the dataset scores: (optional) confidence scores for each box figsize: (optional) the size of the image. #compute the number of person temp [] for i, person in enumerate(class_ids): if person 1: temp.append(i) else: pass person_number len(temp) person_site {} for i in range(person_number): person_site[i] temp[i] NN boxes.shape[0] # Number of personinstances #N boxes.shape[0] N person_number if not N: print(\n*** No person to display *** \n) else: # assert boxes.shape[0] masks.shape[-1] class_ids.shape[0] pass if not ax: _, ax plt.subplots(1, figsizefigsize) # Generate random colors colors random_colors(NN) # Show area outside image boundaries. height, width image.shape[:2] ax.set_ylim(height 10, -10) ax.set_xlim(-10, width 10) ax.axis(off) ax.set_title(title) masked_image image.astype(np.uint32).copy() for a in range(N): color colors[a] i person_site[a] # Bounding box if not np.any(boxes[i]): # Skip this instance. Has no bbox. Likely lost in image cropping. continue y1, x1, y2, x2 boxes[i] p patches.Rectangle((x1, y1), x2 - x1, y2 - y1, linewidth2, alpha0.7, linestyledashed, edgecolorcolor, facecolornone) ax.add_patch(p) # Label class_id class_ids[i] score scores[i] if scores is not None else None label class_names[class_id] x random.randint(x1, (x1 x2) // 2) caption {} {:.3f}.format(label, score) if score else label ax.text(x1, y1 8, caption, colorw, size11, backgroundcolornone) # Mask mask masks[:, :, i] masked_image apply_mask(masked_image, mask, color) # Mask Polygon # Pad to ensure proper polygons for masks that touch image edges. padded_mask np.zeros( (mask.shape[0] 2, mask.shape[1] 2), dtypenp.uint8) padded_mask[1:-1, 1:-1] mask contours find_contours(padded_mask, 0.5) for verts in contours: # Subtract the padding and flip (y, x) to (x, y) verts np.fliplr(verts) - 1 p Polygon(verts, facecolornone, edgecolorcolor) ax.add_patch(p) ax.imshow(masked_image.astype(np.uint8)) plt.show()4 实现效果原视频生成帧蒙板最终效果最后项目分享见主页任意置顶文章
延伸阅读

更多相关文章

2026/9/25 1:47:57

软件知识产权保护:从历史争议到现代技术对抗

1. 软件知识产权争议的历史溯源1976年2月,时年21岁的哈佛大学辍学生比尔盖茨撰写了一封致计算机爱好者的公开信,这封题为《致电脑爱好者的公开信》的文档,成为了软件行业发展史上的标志性事件。当时微软刚成立不到一年,主要产品是…

2026/9/20 2:46:28

NOI经典01串问题:滑动窗口与单调队列解法详解

1. 项目背景与题目解析 这道来自NOI1999的经典题目"01串"(题目编号P5627/P5751)是信息学奥林匹克竞赛中极具代表性的字符串处理类问题。题目要求我们分析由0和1组成的特定序列,找出满足特定条件的最长子串。这类题目在信奥赛场上频…

2026/9/25 8:42:54

Atlas 300V 部署 YOLO 实战:从模型转换到推理调优全指南

如果你也在纠结“atlas部署yolo”到底怎么搞,以及“Atlas 300V 24G是不是运算加速卡”这类问题,那这篇应该能省你不少时间。我手头有一台装了Atlas 300V 24G的推理服务器,近一年里一直在上面跑目标检测项目,从模型转换到推理服务、…

2026/9/25 8:42:54

Atlas 300V 24G上跑通YOLO:昇腾推理部署全流程解析

搞AI算法工程的朋友,这两年应该没少被“国产算力”“昇腾生态”“Atlas”这几个词刷屏。尤其是做边缘视频分析、工业质检、智慧园区这类项目的团队,经常会在选型阶段卡在同一个问题上:手里的YOLO模型,到底怎么跑到华为Atlas上&…

2026/9/25 8:42:54

DBD仿真中电子密度分布的建模与求解全流程解析

1. 为什么盯着电子密度分布:DBD仿真的真正价值做介质阻挡放电(Dielectric Barrier Discharge, DBD)仿真的人,十有八九第一眼盯的都是放电形态和击穿电压,但真到了工业落地这一步,才能真正体会到&#xff1a…

2026/9/25 8:42:54

基于atlas平台的YOLO模型部署与推理优化实践

1. 先聊清楚 atlas 到底是个什么项目先说结论:atlas 不是某个单一算法,也不是某个跑分工具,而是一整套面向视觉任务(尤其是目标检测类模型)的部署与在线推理解决方案。简单点说,它的核心工作是:…

2026/9/25 8:42:54

AI编程驱动视频自动化:ffmpeg+Remotion+Manim+Claude Code工作流

1. 从"video-use"这个模糊标题说起:我到底想解决什么问题第一次看到"video-use"这个标题,加上空白的正文和关键词,我脑子里其实也愣了一下。但结合热搜词里那一串Claude Code、ffmpeg、Remotion、Manim,我大概…

2026/9/24 20:24:47

GAMP 5 基于风险的计算机化系统验证:软件分类与审计追踪实践

简介:《A Risk-Based Approach to Compliant GxP Computerized Systems》即业内熟知的GAMP 5指南,面向制药企业质量与IT合规人员、验证工程师及计算机化系统管理者,用于解决GxP法规环境下系统合规性难以科学落地的问题。文档以风险管理为主线…

2026/9/23 12:06:55

安全托管MSSP实战:从静态防御到人机协同的攻防运营与应急响应

简介:这份PPT围绕互联网业务安全托管服务展开,面向企业安全负责人、IT运维人员及关注MSSP/MSS选型的读者,重点回应传统安全过度依赖人工、碎片化静态防御难以对抗产业化攻击等痛点。资源共1个pptx文件,包体约30.63MB,以…

2026/9/25 0:02:35

AI元人文:从工具使用到思维重构的深度探索

最近半年我一直在琢磨一件事:AI元人文到底是什么?说白了,就是“用元视角重新审视人与AI的关系”,也在“探索AI如何反向逼着我们发现自己的思考边界”。标题里的“元探索”,在我看就是一层套一层的追问——当你用AI解决…

2026/9/25 0:02:35

Python+CNN车牌识别实战:从数据预处理到模型训练与部署

简介:基于Python与卷积神经网络的车牌识别项目,面向计算机视觉初学者及智能交通开发者,目标是帮助用户掌握从数据预处理、模型构建到实际部署的完整流程。压缩包共25个文件,包含jpg/png图像样本、py训练脚本、md说明文档、dat数据…

2026/9/25 0:02:35

Vim基础操作全攻略:保存退出、模式切换与高频命令实战

1. 项目概述1.1 核心需求解析今天聊聊Vim。写这个题目的原因是:几乎每个后端开发者、运维人员、数据工程师某天都会遇到一个场景——深夜加班,服务器登录界面只有黑底白字,编辑器只有vi/vim,你必须在五分钟内完成一次配置修改并保…

2026/9/22 16:34:32

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/22 20:01:30

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/22 13:25:41

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
☎咨询二维码 ☎ ↑