指南首页/研究方向
EN
研究方向

计算机视觉:让模型读懂图像

照片里是什么、东西在哪里、哪些像素属于同一个物体,以及怎样从图像认识三维场景,都是视觉研究中的问题。它也是一个很容易从结果产生兴趣的入口:你能直接看见模型认对和认错了什么。

计算机视觉研究怎样从图像和视频中提取有用的信息。相册按人物整理、路口统计车辆、医学影像中勾出病灶,都要把像素变成可用的判断。分类回答是什么,检测补上位置,分割细到每个像素;三维视觉还要恢复距离、形状和空间关系。

入门时先选一种输出,再看模型如何得到它。卷积网络用同一组小滤镜在不同位置提取局部特征,视觉 Transformer 则把图像切成小块,让这些块交换信息。结构之外,数据怎样标注、测试图与训练图差多少,也常常决定模型能不能用。

主要任务
  • 识别与检索:给图片分类,或从图库里找到相似内容。
  • 定位与测量:找出物体的位置、轮廓,统计数量或估计尺寸。
  • 场景理解:结合连续画面或多个视角,估计运动、深度与三维结构。

先把一种任务的输入、标注和评价指标讲明白,再比较网络。

图像怎样经过视觉网络
  1. 01输入图像
  2. 02提取特征
  3. 03目标检测
  4. 04像素分割
  5. 05估计深度

发展路线与代表工作

  1. 2012

    从手工特征到学习特征

    AlexNet 让卷积网络在大规模图像分类中显示出优势。一起看数据、GPU 训练和模型结构,才能理解这次进展。

  2. 2016

    网络加深,为什么反而难学

    ResNet 用跨层相加的连接改善深层网络的优化。这里的问题是怎样把网络训好,学到的视觉特征也能服务其他任务。

  3. 2016

    另一条任务线:同时识别与定位

    YOLO 直接从整张图预测框和类别,把检测写成一个统一的预测问题。它与分类网络不是前后替代关系。

  4. 2021

    把图像看成一串小块

    ViT 将图像块送入 Transformer,并研究大规模预训练怎样影响效果。卷积与注意力由此成为可以按任务、数据和成本选择的设计。

关键概念

卷积 / CNN
让一个小滤镜在图像上移动,同一组参数检查不同位置。多层组合后,可以从局部纹理形成更复杂的特征。
特征 / representation
模型中间层产生的一组数字,用来保留对任务有用的信息。它可以交给分类器,也可以供检测、检索等任务使用。
Patch 与 attention
Patch 是切下来的图像块;attention 按输入内容决定各块之间交换多少信息。一个块不是天然对应一个物体。
IoU 与 mAP
IoU 衡量预测框与真实框的重叠程度;mAP 汇总各类别检测的精确率与召回率关系。比较 mAP 时要对齐重叠阈值和评价协议。

从分类、检测与分割开始

从 MNIST 手写数字识别或 YOLO 目标检测开始:前者做一次训练、预测和 Kaggle 提交,后者先在自己的图片上看到检测结果,再尝试训练。再看 CS231n 的视觉任务、训练与卷积网络相关内容。

分类回答是什么,检测还要给出位置,分割进一步决定每个像素属于什么。选择其中一个你感兴趣的任务,再去看相应数据和指标。

特征、感受野与泛化

读 ResNet 可以认识一个结构变化怎样通过实验论证。对卷积中的感受野好奇,可以读 Distill 的可视化讲解。

把一次预测打开看:模型容易把哪些情况弄错,遮住背景之后是否变化,换一个数据来源又怎样。这些现象会把你带到数据、表示与泛化。

视觉与语言、生成、动作的联系

想把图像和语言联系起来,接多模态;想生成图像,接生成模型;想让视觉服务动作,接具身智能。碰到运行速度与内存问题,就去系统页。

视觉课程与研究团队

课程与项目见视觉资料目录;想看视觉怎样和机器人任务联系,可以从SVL、RAIL 等团队的项目开始。

代表论文

先用 AlexNet 和 ResNet 读懂特征学习与训练,再按兴趣选 YOLO 或 ViT;每篇都对照输入、输出和实验看。

2012 · NIPS 2012

ImageNet Classification with Deep Convolutional Neural Networks

ImageNet Classification with Deep Convolutional Neural Networks · Krizhevsky et al. · Fig. 2
论文原图 · Krizhevsky et al. · Fig. 2 · 论文原文

它在解决什么

能否让网络从大量图片里学出识别物体的特征?

核心想法

用多层卷积从像素逐层提取特征,配合 GPU 训练、ReLU 和抑制过拟合的办法。

为什么选这篇

它适合用来认识数据规模、计算和训练方法怎样共同促成进展。

第一遍读哪里

先看网络结构与训练做法,再看分类结果和错误示例。

读完还要问

研究重点是预设类别的图像分类,不能直接回答物体在哪里。

2016 · CVPR 2016

Deep Residual Learning for Image Recognition

Deep Residual Learning for Image Recognition · He et al. · Fig. 5
论文原图 · He et al. · Fig. 5 · 论文原文

它在解决什么

为什么网络加深之后,连训练集也可能学得更差?

核心想法

让一组层学习相对输入的改变量 F(x),再把输入加回去,得到 x + F(x)。

为什么选这篇

一个容易画清楚的结构变化,配合普通网络与残差网络的对照实验。

第一遍读哪里

先看退化问题和残差模块,再比较不同深度的训练误差。

读完还要问

残差连接改善优化,不保证任意加深都会更准;数据与计算成本仍然重要。

2016 · CVPR 2016

You Only Look Once: Unified, Real-Time Object Detection

You Only Look Once: Unified, Real-Time Object Detection · Redmon et al., YOLO, Figure 2
论文原图 · Redmon et al., YOLO, Figure 2 · 论文原文

它在解决什么

怎样在一次网络前向计算中同时预测物体类别和位置?

核心想法

从整张图直接预测一组框及相应分数,把识别和定位放进同一个训练目标。

为什么选这篇

和入门检测 demo 能对上:看得到框,也能分析漏检、误检和速度。

第一遍读哪里

先看检测流程和网格预测方式,再看定位误差的分析。

读完还要问

原版在小物体、密集物体和精确定位上有明显局限;今天名为 YOLO 的工具已有许多结构变化。

2021 · ICLR 2021

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale · Dosovitskiy et al. · Fig. 1
论文原图 · Dosovitskiy et al. · Fig. 1 · 论文原文

它在解决什么

图像分类是否必须依赖卷积这种局部结构?

核心想法

把图像切成小块,转换成向量,再用 Transformer 在块之间交换信息。

为什么选这篇

它把视觉与语言中的序列处理联系起来,也强调预训练数据规模的作用。

第一遍读哪里

先看图像块如何进入网络,再看不同预训练规模的比较。

读完还要问

原论文的强结果依赖大规模预训练,不能据此认为小数据上 Transformer 一定胜过 CNN。

入门练习

卡在某一步?把过程带到 AMA 一起聊 ↗