Tips
EE6122-P2-Topic2-WDM设备
引入对于一个光纤通信系统,其基本的组件主要有:
发射器:发射光的半导体设备,然后,来自发射器的光被耦合到传输介质中,也就是一段光纤。
光纤:在较长的距离上,光会完全被限制在一段光纤中
光电探测器:最终,光线会到达另一端,然后这部分光线会被光电探测器检测到
但现在我们转向 WDM 系统, WDM 是一种更先进的通信系统,它将光波系统的容量扩展到超过 1 Tb/s。由于多个光学载波间隔50–100 GHz,同时在同一光纤上传输数据,除了现有的三种类型的组件,还需要能精确处理这些信道的组件。
WDM中有许多基于波导的无源和有源组件:
可调谐光滤波器(Tunable optical filters)用于信道选择
解复用器和复用器(Demultiplexers and multiplexers)用于组合信道
分插复用器(Add–drop multiplexers)用于添加或下路信道
WDM 发射机(transmitters )用于多信道输入
光开关用于开/关
光滤波器 (optical filters)光滤波器的核心本质,是对特定波长的光信号具备高透射 / 高反射的波长选择特性。一个理想 ...
EE6427-P1-视频信号引入与基础
图像与视频基础图像的色深(Bit Depth/ Color Depth)色深是指用多少bit的来表达一个像素。例如二值图就只使用1bit,每个像素是纯黑或者纯白。典型的灰度图片使用8bit,每个像素从黑到白有256级过度(0-255)。
图像的色彩空间(Color Spaces)彩色图像可以用不同的颜色空间表示,常见的有 RGB、HSI、YCbCr 等。
RGB色彩空间:RGB 是通过红(R)、绿(G)、蓝(B)三个基色的组合来表示颜色的空间。RGB的色彩立方图如下,RGB色彩空间存储三个色彩的亮度。例如,在24bit彩色图像中,$(0,0,255)$就表示R和G都是0,Blue是255(最大等级),因此色彩是全蓝。若三者都是255,则是全白;三者都是0,则是全黑。
YUV,YIQ,YCbCr:
YUV 是一类颜色空间的基础,衍生出 YIQ、YCbCr 等变体。其中,Y(亮度分量)是指图像的 “黑白部分”,描述亮度信息。UV(色度分量)对应图像的 “颜色部分”,描述色彩信息。
因为人眼对亮度(Y)更敏感,对色度(UV)敏感度低,所以可以压缩 UV 的带宽,节省传输资源。也正因 ...
EE6122-P2-Topic4-光纤电缆与测量
光缆技术光缆的核心作用与基础特性单根裸光纤包层直径仅125μm,材质为石英玻璃,粗细与人的头发丝相当,机械强度极低、脆性强,无法直接用于现场工程布设。光缆是光通信工程中光纤的唯一实际应用形态,核心作用为:
将多根光纤成束封装,通过多层护套、加强结构与功能层,为光纤提供机械保护与环境防护
大幅提升光纤的机械强度、柔韧性与环境适应性,满足不同场景的工程布设需求
影响光缆的外部因素光缆设计的核心逻辑是针对各类影响因素做针对性防护,其中机械因素导致的故障占比超90%,其余环境、人为等因素占比不足10%。
机械效应应力光纤应力主要产生于制备与施工两大环节,分为两类:
残余应力(Residual fiber strain)
产生来源:光纤拉丝过程中1800℃高温到室温的骤冷导致的光纤内应力;光缆封装过程中涂覆、固化、环氧树脂固定等高温工艺带来的温差应力
核心影响:长期累积后缩短光纤使用寿命,最终导致光纤无征兆断裂
核心特点:具有滞后性、累积性,不会立刻显现,影响光纤长期可靠性
冲击应力(Impulsive fiber strain)
产生来源:施工过程中的不当操作,包括光缆突然坠落、布 ...
EE6427-P6-新兴AI技术
Foundation Models (FMs)什么是基础模型所谓基础模型,是基于大规模预训练和下游微调的一种新的AI范式。模型先在海量、多样化的数据上进行训练,构成基础模型。然后基础模型进行些许调整,即可用于后续的“下游任务”(downstream tasks)。
第一步是“通识教育”(预训练):让 AI 像海绵吸水一样,在互联网上阅读海量的、未经人工精细标注的文本或图片。AI 在这个过程中自己寻找规律(自监督学习),建立起对世界的基本认知和常识,这就是打好了“基础”。
第二步是“职业培训”(微调/适应):当 AI 毕业后,如果你想让它当客服,就给它几本客服手册让它学一下(微调);你想让它做翻译,就让它看点翻译教材。因为底子好,它能极快地适应各种具体的工作(下游任务)。
调整 / 微调 FMs (Adapting / Finetuning)微调什么是微调?:为特定的下游任务/用例调整预训练模型参数的过程。预训练模型拥有海量且多样化的知识,但在特定领域缺乏专精(缺乏专业性)。微调通过让模型从特定领域的数据中学习来填补这一空白,使其在目标应用中更加准确和有效。
微调的流程 (Fine- ...
EE6122-P2-Topic3-光子集成
引入近年来,通信速率持续上涨,现在有进一步增加数据的需求。
现有的光学方案需要较大的空间,较高的功率。我们传输的数据越多,功耗就越高。这也是目前 AI 技术的现状。甚至在新加坡,政府也开始考虑建设核反应堆。为了支持这种电力需求。
光子集成可以大幅较空间和功耗,还能带来更高带宽,可批量制造等特性。光子集成代表所有的光器件都可以被集成在一块小芯片上,唯一没有改变的部分是光纤。
光子学电子学(Electronics)是研究电荷流(电子)在各种材料和器件(如半导体、电阻、电感、电容、纳米结构等)中运动的学科。
光子学(Photonics)是关于产生/控制/检测光以及其他形式辐射能的技术,其量子单位是光子(photon)。(在物理学中,量子是参与相互作用的任何物理实体的最小单位。这个词来自拉丁语“quantus”,意思是“多少”。)这门科学包括光的发射、传输、偏转、放大和检测。光子学的重要性通常源于光学和电子学之间强大的相互作用。
光子技术可以:
通信 (Communications) → 光纤通信,光无线链路
计算 (Computing) → 芯片间光互连,片上光互连
能源 (Energy) ...
EE6427-Video_Signgal_Processing-P4-AI_Models_&_Architecture
引入深度学习模型为何需要不同的深度学习架构?
因为不同的架构有不同的特性,可以在不同的领域应用。他们都是为了不同的特定问题设计的。
CNN: 最初,CNN 是为解决计算机视觉问题而开发的。CNN由不同的层组成,较浅的层会尝试提取一些简单的特征,如线条和边缘,等等,而后面的层会尝试提取更复杂和抽象的东西。CNN常用于分类任务。
RNN:RNN是一种专门用于处理序列的神经网络,常用于设计时间序列和状态序列预测建模中。(例如预测股票价格,语言翻译)。看到下图这个例子,x是输入,y是输出,h是隐藏层。当前的隐藏状态 h3,将取决于你当前的输入以及所有过去的输入被抽象出的h2。这就是它能处理序列信息的原因。
Transformer:一种使用注意力机制的并行处理输入序列的模型,在许多视觉和NLP应用中,这是最先进的模型。
所谓注意力机制,可以通过这个例子来理解:我给你一个词“mouse”,你会想到什么?老鼠,比如《猫和老鼠》里的卡通老鼠。也可能是这样的电脑鼠标。如果你只听到“mouse”这个词,这个“mouse”是什么意思呢?你如何理解这个单词的含义?你需要查看周围的单词,也就是所谓的上下 ...
EE6427-P5-视频分析与理解
目标检测引入目标检测主要是在图像/视频中预测对象类别,并使用边界框进行定位。
它本质是一个一个回归(regression) + 分类(classification)任务。回归是找到边界框,分类是识别边界框内的类别。
应用目标检测和跟踪的是多个下游计算机视觉任务的关键步骤,例如:
物体跟踪(Object tracking)
姿态估计(Pose Estimation)
动作识别(Action recognition)
它的实际应用有:
自动驾驶
视频监控、监测
发展历史
在早期,AI出现之前,2001 年的 VJ 检测器、2006 年的 HOG 检测器、2008 年的 DPM,是这个阶段的里程碑。但传统方法有一个致命的短板:它极度依赖人工设计的特征,泛化能力极差,一旦遇到视角变化、光照变化、物体遮挡、背景杂乱的场景,检测效果就会急剧下滑。
转折点出现在AlexNet出现之后,AlexNet是一个CNN模型。在此之后,深度学习彻底改写了目标检测的技术路线,我们也进入了基于深度学习的检测时代。这个阶段又分化出了两条核心技术路线,也就是我们后面会重点讲解的双阶段(Two-stage)检测 ...
EE6427-Video_Signgal_Processing-P3-Video_Compression&Standards
引入为何视频可以被压缩视频压缩的本质,是消除视频信号里的冗余信息,用最少的比特,保留人眼能感知到的有效画面信息。前面我们提过,冗余信息有以下几类:
1.统计冗余 (Statistical Redundancy): 这是指数据本身存在的重复或可预测的模式。有以下三类
空间冗余 (Spatial Redundancy / 帧内冗余 intraframe redundancy):同一幅图像里,相邻像素的颜色和亮度通常非常相似。比如一张蓝天的图片,大片区域的像素值几乎一样。
时间冗余 (Temporal Redundancy / 帧间冗余):这是指时域上的冗余信息(特指视频)。视频是由连续的帧组成的,相邻两帧之间的内容变化通常很小。比如一个人在说话,只有嘴部在动,背景和人脸的大部分区域都是不变的。所以我们不需要存储每帧的完整图像,只需要存储第一帧的完整信息,后续帧只记录和前一帧的差异即可。
编码冗余 (Coding Redundancy):这是指在数据编码时,使用了过长的编码来表示出现频率高的符号。比如在一个图像中,白色像素出现的频率很高,如果我们用固定长度编码来表示所有颜色,就浪费了空间。 ...
EE6427-Video_Signgal_Processing-P2-Image_Compression&JPEG
引入在图像与视频处理中,Compressing, Coding, Encoding都是指的一件事:通过某种编码方式,将图像或视频压缩成存储或传输效率更高的格式(信源编码)。
压缩由压缩率(Compression Ratio)来进行评价,其定义为压缩前的比特数($B_0$)/压缩后的比特数($B_1$).
\text{Compression ratio}=\frac{B_0}{B_1}图像压缩后可以变为多个符号,这些符号用熵来表示其信息量。例如符号集$S={s_1,s_2,…s_n}$,其熵为:
\eta=H(S)=\sum_{i=1}^np_1\log_2{\frac{1}{p_i}}=-\sum_{i=1}^np_1\log_2{p_i}熵编码:霍夫曼编码霍夫曼编码是JPEG中使用的编码形式。霍夫曼码是一种无损压缩的可变长编码,它根据统统计信息来分配码字。使得更频繁出现的信息有更短的码字,而不频繁出现的信息则占用更长的码字。以此实现无损压缩。
如何编码横向写法考虑这个例子,现在有$s_0-s_4$5个符号,他们出现的概率分别是:
符号
$s_0$
$s_1$
$s_2$
...
EE6108罐装知识
链路层
若单帧出错概率是P,那么,$Nr=\frac{1}{1-p}$
ALOHA 脆弱期 2F, Slotted ALOHA F, CSMA $t_{prop}$
CSMA碰撞浪费$t_{frame}$的时间,CSMA/CD碰撞浪费$2t_{prop}$的时间
CSMA/CD最大吞吐量公式$\rho_{max}=\frac{t_{frame}}{t_{frame}+t_{prop}+2et_{prop}}$
网络层
IP 分段相关字段:
Identification:分段标识符
DF:Don’t Fragment,不分段标识符
MF:More Fragment,还有分段标识符
Offset:数据片段在原数据中的offset,单位为8byte
HLEN:IP头长度,单位为4Bytes,最低为5
Total Length:整个IP包长度,单位为Bytes
Dijikstra算法:
初始化:记目标节点邻接的节成本为$D(v)=c(u,v)$;非邻接$D(v)=\infty$
找到拥有最小的$D(v)$的未着色节点$w$,前往着色。并更新所有节点的$D(v)=\min{D(v),D(w ...