【202504】Wan-01-数据篇:数十亿视频和图像组成的数据集

发布时间:2026/9/12 15:11:07

【202504】Wan-01-数据篇:数十亿视频和图像组成的数据集 wan: Open and Advanced Large-Scale Video Generative ModelsWan:开放且先进的大规模视频生成模型Wan Team, Alibaba Group Wan 团队,Alibaba Group3 Data Processing Pipeline3 数据处理流水线High-quality data is essential for training large generative models, and an automated data construction pipeline significantly enhances the efficiency of the training process. In developing our dataset, we prioritized three core principles: high quality, high diversity, and substantial scale. Following these principles, we curated a dataset comprisingbillions of videos and images. This section offers a detailed introduction to the data construction pipeline employed for Wan.高质量数据对于训练大型生成模型至关重要,而自动化的数据构建流水线显著提升了训练过程的效率。在开发我们的数据集时,我们优先遵循三个核心原则:高质量、高多样性大规模。基于这些原则,我们构建了一个由数十亿视频和图像组成的数据集。本节将详细介绍 Wan 所采用的数据构建流水线。We curated and deduplicated a candidate dataset sourced from both internal copyrighted sources and publicly accessible data. In the pre-training stage, our goal is to select high-quality and diverse data from this expansive yet noisy dataset to facilitate effective training. Throughout the data mining process, we designed a four-step data cleaning process, focusing on fundamental dimensions, visual quality, and motion quality. Subsequently, we will also highlight our data processing workflow for constructing visual text data.我们从内部版权来源和公开可访问的数据中整理并去重了一个候选数据集。在预训练阶段,我们的目标是从这个规模庞大但噪声较多的数据集中筛选出高质量且多样化的数据,以促进有效训练。在整个数据挖掘过程中,我们设计了一个四步数据清洗流程,重点关注基础维度、视觉质量运动质量。随后,我们还将重点介绍我们用于构建视觉文本数据的数据处理工作流。Fundamental dimensions. The fundamental dimensions of our data filtering framework focus on the intrinsic attributes of the source video and image data, enabling efficient preliminary filtering out of all the unsuitable data. Specifically, our multidimensional filtering approach encompasses the following critical aspects: Text detection. A lightweight OCR detector is implemented to quantify text coverage ratios, effectively excluding videos and images with excessive textual elements to maintain visual clarity. Aesthetic evaluation: We use the widely adopted LAION-⋅5B^ { \cdot 5 \mathrm { B } }⋅5B(Schuhmann et al., 2021) aesthetic classifier to perform an initial quality assessment of our images, quickly filtering out lowquality data. NSFW Score. Through our internal safety assessment model, we systematically evaluate and filter inappropriate content based on computed NSFW scores in all training data. Watermark and logo detection. We detect whether the video or images contain watermarks and logos, and crop these elements during training. Black border detection. Utilizing heuristic-based detection methods, we automatically crop extraneous black borders to maintain focus on content-rich regions. Overexposure detection. Our trained expert classifier evaluates and filters out data with abnormal tonal distributions, ensuring optimal visual quality in the training dataset. Synthetic image detection. Empirical evidence indicates that even minimal contaminationKaTeX parse error: Undefined control sequence: \textless at position 3: ( \̲t̲e̲x̲t̲l̲e̲s̲s̲ ̲1 0 \%) by generated images can significantly degrade the performance of the model. Therefore, we train an expert classifier to filter out these “contaminating” images. Blur detection. An internally developed model assigns quantitative blur scores to training materials, enabling the systematic removal of visually indistinct content. Duration and resolution. We also enforce constraints where video duration must exceed 4 seconds, and resolution thresholds are applied at different training stages to filter out low-quality data. Through the implementation of these efficient preprocessing strategies, we successfully eliminated approximately50%5 0 \%50%of the initial dataset. The retained high-quality data subsequently progresses to a more superior semantic-driven selection stage for further refinement.基础维度。我们数据过滤框架的基础维度聚焦于源视频和图像数据的内在属性,从而能够高效地初步过滤掉所有不合适的数据。具体而言,我们的多维过滤方法涵盖以下关键方面:文本检测。我们实现了一个轻量级 OCR 检测器来量化文本覆盖率,有效排除包含过多文本元素的视频和图像,以保持视觉清晰度。美学评估:我们使用被广泛采用的 LAION-5B(Schuhmann et al., 2021) 美学分类器,对图像进行初步质量评估,快速过滤低质量数据。NSFW 分数。通过我们的内部安全评估模型,我们基于计算得到的 NSFW 分数,对所有训练数据中的不当内容进行系统性评估和过滤。水印和 logo 检测。我们检测视频或图像中是否包含水印和 logo,并在训练过程中裁剪这些元素。黑边检测。利用基于启发式的检测方法,我们自动裁剪多余的黑边,以保持对内容丰富区域的关注。过曝检测。我们训练的专家分类器会评估并过滤掉色调分布异常的数据,确保训练数据集具有最佳视觉质量。合成图像检测。实证表明,即使是极少量(
延伸阅读

更多相关文章

2026/9/10 14:14:34

天天刷网页、打游戏,你真的了解背后的“无名英雄”服务器吗?

大家好!我们每天都在网上冲浪、玩网页游戏、刷社交平台,只要点一下鼠标,想要的内容就会立刻跳出来。但你有没有想过,这些海量的数据到底是从哪里来的? 今天就来和大家聊聊支撑起整个互联网世界的幕后大佬——服务器&a…

2026/9/11 15:09:39

AI Agent开发实战:从核心原理到电商客服系统完整项目

如果你正在学习AI Agent开发,可能会遇到这样的困惑:看了很多教程,但真正动手时还是不知道从何开始;或者跟着示例代码跑通了,但一到实际项目就束手无策。这其实不是你的问题,而是大多数教程只讲"是什么…

2026/9/12 15:10:47

ESP32-S3 N16R8开发实战:Flash/PSRAM配置与PlatformIO避坑指南

1. 为什么选 ESP32-S3 N16R8?不是参数堆砌,而是真实开发场景的硬需求 你手上刚拆封那块印着“ESP32-S3-N16R8”的小板子,背面丝印清晰写着 16MB PSRAM 8MB Flash——这串数字不是厂商炫技的广告语,而是你在做 USB 摄像头、Micro-…

2026/9/12 15:10:47

SEO关键词研究:从工具到实战的完整指南

1. SEO关键词研究的底层逻辑2003年我刚入行时,搜索引擎优化还停留在"堆砌关键词"的野蛮生长阶段。如今算法迭代了上百个版本,但关键词研究始终是SEO的基石。真正专业的关键词研究不是简单地统计搜索量,而是要理解用户意图与商业价值…

2026/9/12 15:10:47

差分探头匹配电容选型原理与高速信号实测调优指南

1. 差分探头匹配电容:为什么它不是“随便找个瓷片就能用”的小零件? 差分探头匹配电容——这六个字,听起来像实验室角落里不起眼的配件标签,但在我拆过37支不同品牌差分探头、调坏过11块高速PCB板、被示波器上诡异的振铃波形折磨到…

2026/9/12 15:05:46

AI全栈应用开发实战:从架构设计到工程落地的完整指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

2026/9/12 2:05:33

超人会飞不算本事:系统稳定依赖清晰规则与边界设计

开头先不绕弯子。“#斯坦李吐槽dc 所以超人是无缘无故会飞的嘛哈哈哈哈哈哈哈锤哥真是技术人才啊!#雷神 #复联”这类调侃式短标题,第一波冲击力在于它把两个宇宙的角色塞进同一个吐槽箱里,但细想一下就能发现,它真正碰到的根本不是…

2026/9/12 3:55:12

超人VS蜘蛛侠:拆解超级IP的影响力与传播方法论

把“蜘蛛侠 vs 超人”放在 CSDN 上聊,可能很多人第一反应是走错片场了。但如果把这两个角色看成“两个持续运营了 80 多年的文化产品”,你会发现,这场比较本质上是两个不同 IP 策略的长期结果对比:超人赢在定义了整个超级英雄题材…

2026/9/12 10:09:03

基于CNN的调制信号识别:MATLAB实现时频图分类实战

简介:本资源是一套面向通信工程与信号处理方向学习者、研究者的深度学习实践方案,聚焦调制信号自动检测与识别这一典型无线通信任务,解决传统方法依赖人工特征、低信噪比下性能下降等痛点。压缩包共12个文件(10.73MB)&…

2026/9/12 0:04:17

MATLAB仿生优化框架:长鼻浣熊算法多策略融合实现

简介:本资源是一份面向智能优化算法研究者与MATLAB初学者的仿生智能算法实践代码包,聚焦于长鼻浣熊优化算法(COA)的多策略改进与性能验证。针对传统COA易陷局部最优、收敛精度不足等问题,作者融合Circle映射初始化提升…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 JavaWeb 的校园一卡通管理系统的设计与实现 基于 JavaWeb 的校园卡业务管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/12 0:04:17

【JAVA毕设源码分享】基于 Java 的图书馆借阅管理平台的搭建与实现 基于 Java 的图书馆综合管理系统(程序+文档+代码讲解+一条龙定制)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

2026/9/12 6:29:36

USB Type-C PCB布局分区设计:电源、高速信号与PD协议全攻略

做硬件这行,Type-C接口算是典型的“看着简单,做起来全坑”的东西。光引脚就24个,高低速信号、电源、控制线全部塞在一个小小的连接器里,如果PCB布局不做规划,打样回来基本就是“插上没反应”、“高速掉线”、“静电一打…

2026/9/12 14:32:17

系统编程学习原型如何补齐稳定性边界

系统编程学习原型如何补齐稳定性边界预算有限时&#xff0c;我先优化明显多余的复制&#xff0c;而不是猜测性地换容器。用借用传递只读数据通常就能减少分配&#xff1a; fn parse(line: &str) -> Result<Item, Error> { /* ... */ }用基准确认热点确实在分配&am…

2026/9/12 6:37:43

雨花区哪家财务公司代理记账比较好?

在雨花区&#xff0c;企业处理财税事务常常面临诸多挑战&#xff0c;选择一家靠谱的财务公司至关重要。湖南巨勤财务管理咨询有限公司就是本地正规实体财税服务机构&#xff0c;深耕本地工商财税行业多年&#xff0c;熟悉当地工商局、税务局最新政策与申报流程。主营公司注册、…

还想了解更多?直接咨询顾问

免费诊断 + 免费方案 + 透明报价。

全国咨询热线400-8866-253
免费获取方案
咨询二维码