EE6427-P1-视频信号引入与基础
图像与视频基础图像的色深(Bit Depth/ Color Depth)色深是指用多少bit的来表达一个像素。例如二值图就只使用1bit,每个像素是纯黑或者纯白。典型的灰度图片使用8bit,每个像素从黑到白有256级过度(0-255)。
图像的色彩空间(Color Spaces)彩色图像可以用不同的颜色空间表示,常见的有 RGB、HSI、YCbCr 等。
RGB色彩空间:RGB 是通过红(R)、绿(G)、蓝(B)三个基色的组合来表示颜色的空间。RGB的色彩立方图如下,RGB色彩空间存储三个色彩的亮度。例如,在24bit彩色图像中,$(0,0,255)$就表示R和G都是0,Blue是255(最大等级),因此色彩是全蓝。若三者都是255,则是全白;三者都是0,则是全黑。
YUV,YIQ,YCbCr:
YUV 是一类颜色空间的基础,衍生出 YIQ、YCbCr 等变体。其中,Y(亮度分量)是指图像的 “黑白部分”,描述亮度信息。UV(色度分量)对应图像的 “颜色部分”,描述色彩信息。
因为人眼对亮度(Y)更敏感,对色度(UV)敏感度低,所以可以压缩 UV 的带宽,节省传输资源。也正因 ...
EE6427-P6-新兴AI技术
Foundation Models (FMs)什么是基础模型所谓基础模型,是基于大规模预训练和下游微调的一种新的AI范式。模型先在海量、多样化的数据上进行训练,构成基础模型。然后基础模型进行些许调整,即可用于后续的“下游任务”(downstream tasks)。
第一步是“通识教育”(预训练):让 AI 像海绵吸水一样,在互联网上阅读海量的、未经人工精细标注的文本或图片。AI 在这个过程中自己寻找规律(自监督学习),建立起对世界的基本认知和常识,这就是打好了“基础”。
第二步是“职业培训”(微调/适应):当 AI 毕业后,如果你想让它当客服,就给它几本客服手册让它学一下(微调);你想让它做翻译,就让它看点翻译教材。因为底子好,它能极快地适应各种具体的工作(下游任务)。
调整 / 微调 FMs (Adapting / Finetuning)微调什么是微调?:为特定的下游任务/用例调整预训练模型参数的过程。预训练模型拥有海量且多样化的知识,但在特定领域缺乏专精(缺乏专业性)。微调通过让模型从特定领域的数据中学习来填补这一空白,使其在目标应用中更加准确和有效。
微调的流程 (Fine- ...
EE6427-Video_Signgal_Processing-P4-AI_Models_&_Architecture
引入深度学习模型为何需要不同的深度学习架构?
因为不同的架构有不同的特性,可以在不同的领域应用。他们都是为了不同的特定问题设计的。
CNN: 最初,CNN 是为解决计算机视觉问题而开发的。CNN由不同的层组成,较浅的层会尝试提取一些简单的特征,如线条和边缘,等等,而后面的层会尝试提取更复杂和抽象的东西。CNN常用于分类任务。
RNN:RNN是一种专门用于处理序列的神经网络,常用于设计时间序列和状态序列预测建模中。(例如预测股票价格,语言翻译)。看到下图这个例子,x是输入,y是输出,h是隐藏层。当前的隐藏状态 h3,将取决于你当前的输入以及所有过去的输入被抽象出的h2。这就是它能处理序列信息的原因。
Transformer:一种使用注意力机制的并行处理输入序列的模型,在许多视觉和NLP应用中,这是最先进的模型。
所谓注意力机制,可以通过这个例子来理解:我给你一个词“mouse”,你会想到什么?老鼠,比如《猫和老鼠》里的卡通老鼠。也可能是这样的电脑鼠标。如果你只听到“mouse”这个词,这个“mouse”是什么意思呢?你如何理解这个单词的含义?你需要查看周围的单词,也就是所谓的上下 ...
EE6427-P5-视频分析与理解
目标检测引入目标检测主要是在图像/视频中预测对象类别,并使用边界框进行定位。
它本质是一个一个回归(regression) + 分类(classification)任务。回归是找到边界框,分类是识别边界框内的类别。
应用目标检测和跟踪的是多个下游计算机视觉任务的关键步骤,例如:
物体跟踪(Object tracking)
姿态估计(Pose Estimation)
动作识别(Action recognition)
它的实际应用有:
自动驾驶
视频监控、监测
发展历史
在早期,AI出现之前,2001 年的 VJ 检测器、2006 年的 HOG 检测器、2008 年的 DPM,是这个阶段的里程碑。但传统方法有一个致命的短板:它极度依赖人工设计的特征,泛化能力极差,一旦遇到视角变化、光照变化、物体遮挡、背景杂乱的场景,检测效果就会急剧下滑。
转折点出现在AlexNet出现之后,AlexNet是一个CNN模型。在此之后,深度学习彻底改写了目标检测的技术路线,我们也进入了基于深度学习的检测时代。这个阶段又分化出了两条核心技术路线,也就是我们后面会重点讲解的双阶段(Two-stage)检测 ...
EE6427-Video_Signgal_Processing-P3-Video_Compression&Standards
引入为何视频可以被压缩视频压缩的本质,是消除视频信号里的冗余信息,用最少的比特,保留人眼能感知到的有效画面信息。前面我们提过,冗余信息有以下几类:
1.统计冗余 (Statistical Redundancy): 这是指数据本身存在的重复或可预测的模式。有以下三类
空间冗余 (Spatial Redundancy / 帧内冗余 intraframe redundancy):同一幅图像里,相邻像素的颜色和亮度通常非常相似。比如一张蓝天的图片,大片区域的像素值几乎一样。
时间冗余 (Temporal Redundancy / 帧间冗余):这是指时域上的冗余信息(特指视频)。视频是由连续的帧组成的,相邻两帧之间的内容变化通常很小。比如一个人在说话,只有嘴部在动,背景和人脸的大部分区域都是不变的。所以我们不需要存储每帧的完整图像,只需要存储第一帧的完整信息,后续帧只记录和前一帧的差异即可。
编码冗余 (Coding Redundancy):这是指在数据编码时,使用了过长的编码来表示出现频率高的符号。比如在一个图像中,白色像素出现的频率很高,如果我们用固定长度编码来表示所有颜色,就浪费了空间。 ...
EE6427-Video_Signgal_Processing-P2-Image_Compression&JPEG
引入在图像与视频处理中,Compressing, Coding, Encoding都是指的一件事:通过某种编码方式,将图像或视频压缩成存储或传输效率更高的格式(信源编码)。
压缩由压缩率(Compression Ratio)来进行评价,其定义为压缩前的比特数($B_0$)/压缩后的比特数($B_1$).
\text{Compression ratio}=\frac{B_0}{B_1}图像压缩后可以变为多个符号,这些符号用熵来表示其信息量。例如符号集$S={s_1,s_2,…s_n}$,其熵为:
\eta=H(S)=\sum_{i=1}^np_1\log_2{\frac{1}{p_i}}=-\sum_{i=1}^np_1\log_2{p_i}熵编码:霍夫曼编码霍夫曼编码是JPEG中使用的编码形式。霍夫曼码是一种无损压缩的可变长编码,它根据统统计信息来分配码字。使得更频繁出现的信息有更短的码字,而不频繁出现的信息则占用更长的码字。以此实现无损压缩。
如何编码横向写法考虑这个例子,现在有$s_0-s_4$5个符号,他们出现的概率分别是:
符号
$s_0$
$s_1$
$s_2$
...