12个常用的图像数据增强技术总结

会员服务 ·

12个常用的图像数据增强技术总结

2022 年 10 月 27 日 极市平台

↑ 点击蓝字关注极市平台

作者丨Prabowo Yoga Wicaksana

来源丨DeepHub IMBA

编辑丨极市平台

极市导读

本文总结了图像增强常用的一些方法，并附相关实现代码。 >>加入极市CV技术交流群，走在计算机视觉的最前沿

机器学习或深度学习模型的训练的目标是成为“通用”模型。这就需要模型没有过度拟合训练数据集，或者换句话说，我们的模型对看不见的数据有很好的了解。数据增强也是避免过度拟合的众多方法之一。

扩展用于训练模型的数据量的过程称为数据增强。通过训练具有多种数据类型的模型，我们可以获得更“泛化”的模型。“多种数据类型”是什么意思呢？本片文章只讨论“图像”数据增强技术，只详细地介绍各种图片数据增强策略。我们还将使用 PyTorch 动手实践并实现图像数据或计算机视觉中主要使用的数据增强技术。

因为介绍的是数据增强技术。所以只使用一张图片就可以了，我们先看看可视话的代码

 import PIL.Image as Image  
 import torch  
 from torchvision import transforms  
 import matplotlib.pyplot as plt  
 import numpy as np  
 import warnings  

 def imshow\(img\_path, transform\):  
  """  
  Function to show data augmentation  
  Param img\_path: path of the image  
  Param transform: data augmentation technique to apply  
  """  
  img = Image.open\(img\_path\)  
  fig, ax = plt.subplots\(1, 2, figsize=\(15, 4\)\)  
  ax\[0\].set\_title\(f'Original image \{img.size\}'\)  
  ax\[0\].imshow\(img\)  
  img = transform\(img\)  
  ax\[1\].set\_title\(f'Transformed image \{img.size\}'\)  
  ax\[1\].imshow\(img\)

Resize/Rescale

此函数用于将图像的高度和宽度调整为我们想要的特定大小。下面的代码演示了我们想要将图像从其原始大小调整为 224 x 224。

 path = './kitten.jpeg'  
 transform = transforms.Resize\(\(224, 224\)\)  
 imshow\(path, transform\)

Cropping

该技术将要选择的图像的一部分应用于新图像。例如，使用 CenterCrop 来返回一个中心裁剪的图像。

 transform = transforms.CenterCrop\(\(224, 224\)\)  
 imshow\(path, transform\)

RandomResizedCrop

这种方法同时结合了裁剪和调整大小。

 transform = transforms.RandomResizedCrop\(\(100, 300\)\)  
 imshow\(path, transform\)

Flipping

水平或垂直翻转图像，下面代码将尝试应用水平翻转到我们的图像。

 transform = transforms.RandomHorizontalFlip\(\)  
 imshow\(path, transform\)

Padding

填充包括在图像的所有边缘上按指定的数量填充。我们将每条边填充50像素。

 transform = transforms.Pad\(\(50,50,50,50\)\)  
 imshow\(path, transform\)

Rotation

对图像随机施加旋转角度。我们将这个角设为15度。

 transform = transforms.RandomRotation\(15\)  
 imshow\(path, transform\)

Random Affine

这种技术是一种保持中心不变的变换。这种技术有一些参数：

degrees：旋转角度
translate：水平和垂直转换
scale：缩放参数
share：图片裁剪参数

fillcolor：图像外部填充的颜色

 transform = transforms.RandomAffine\(1, translate=\(0.5, 0.5\), scale=\(1, 1\), shear=\(1,1\), fillcolor=\(256,256,256\)\)  
 imshow\(path, transform\)

Gaussian Blur

图像将使用高斯模糊进行模糊处理。

 transform = transforms.GaussianBlur\(7, 3\)  
 imshow\(path, transform\)

Grayscale

将彩色图像转换为灰度。

 transform = transforms.Grayscale\(num\_output\_channels=3\)  
 imshow\(path, transform\)

颜色增强，也称为颜色抖动，是通过改变图像的像素值来修改图像的颜色属性的过程。下面的方法都是颜色相关的操作。

Brightness

改变图像的亮度当与原始图像对比时，生成的图像变暗或变亮。

 transform = transforms.ColorJitter\(brightness=2\)  
 imshow\(path, transform\)

Contrast

图像最暗和最亮部分之间的区别程度被称为对比度。图像的对比度也可以作为增强进行调整。

 transform = transforms.ColorJitter\(contrast=2\)  
 imshow\(path, transform\)

Saturation

图片中颜色的分离被定义为饱和度。

 transform = transforms.ColorJitter\(saturation=20\)  
 imshow\(path, transform\)

Hue

色调被定义为图片中颜色的深浅。

 transform = transforms.ColorJitter\(hue=2\)  
 imshow\(path, transform\)

总结

图像本身的变化将有助于模型对未见数据的泛化，从而不会对数据进行过拟合。以上整理的都是我们常见的数据增强技术，torchvision中还包含了很多方法，可以在他的文档中找到：https://pytorch.org/vision/stable/transforms.html

公众号后台回复“开学”获取CVPR、ICCV、VALSE等论文资源下载～

△点击卡片关注极市平台，获取最新CV干货

极市干货

算法竞赛：往届获奖方案总结以及经验详解｜ACCV2022国际细粒度图像分析挑战赛

技术综述： BEV 学术界和工业界方案、优化方法与tricks综述 ｜ PyTorch下的可视化工具（网络结构/训练过程可视化）

极视角动态：极视角与华为联合发布基于昇腾AI的「AICE赋能行业解决方案」｜算法误报怎么办？自训练工具使得算法迭代效率提升50%！

# CV技术社群邀请函 #

△长按添加极市小助手

添加极市小助手微信（ID : cvmart2）

备注：姓名-学校/公司-研究方向-城市（如：小极-北大-目标检测-深圳）

即可申请加入极市目标检测/图像分割/工业检测/人脸/医学影像/3D/SLAM/自动驾驶/超分辨率/姿态估计/ReID/GAN/图像增强/OCR/视频理解等技术交流群

极市&深大CV技术交流群已创建，欢迎深大校友加入，在群内自由交流学术心得，分享学术讯息，共建良好的技术交流氛围。

“

点击阅读原文进入CV社区

收获更多技术干货

登录查看更多

相关内容

变换

关注 2

【经典书】Python地理信息数据分析，362页pdf

专知会员服务

89+阅读 · 2022年7月4日

【经典书】数据科学探索，189页pdf

专知会员服务

62+阅读 · 2022年5月16日

【AI+军事】《检测生成媒体：关于Twitter数据的案例研究》附论文

专知会员服务

20+阅读 · 2022年4月27日

专知会员服务

48+阅读 · 2021年10月16日

2020->2021必看的十篇「深度学习领域综述」论文

专知会员服务

136+阅读 · 2021年1月1日

【Google】深度学习对抗鲁棒性，43页ppt

专知会员服务

45+阅读 · 2020年10月31日

【2020新书】数据结构与数据表示指南，112页pdf

专知会员服务

84+阅读 · 2020年10月6日

【实用书】给开发者的深度学习商业应用指南，348页pdf

专知会员服务

56+阅读 · 2020年7月4日

基于深度网络的自监督视觉特征学习综述，附24页论文下载

专知会员服务

66+阅读 · 2020年1月15日

【综述】深度学习攻防对抗在图像数据、图数据以及文本数据上的应用，附29页PDF

专知会员服务

48+阅读 · 2019年11月21日

论文画图工具：25个常用Matplotlib图的Python代码总结

极市平台

0+阅读 · 2022年11月12日

实操教程｜用Pytorch训练神经网络

极市平台

0+阅读 · 2022年4月22日

损失函数技术总结及Pytorch使用示例

极市平台

3+阅读 · 2022年4月10日

实践教程 | CNN调优总结

极市平台

3+阅读 · 2022年2月10日

图像分类训练技巧之数据增强方法总结

极市平台

1+阅读 · 2022年2月6日

机器学习中四种调参方法总结

极市平台

1+阅读 · 2021年10月19日

使用Python进行图像增强

AI研习社

17+阅读 · 2018年9月30日

实战 | 用Python做图像处理（三）

七月在线实验室

15+阅读 · 2018年5月29日

实战 | 用Python做图像处理（一）

七月在线实验室

25+阅读 · 2018年5月23日

基于Keras进行迁移学习

论智

12+阅读 · 2018年5月6日

图像、光谱、偏振态多维全光信息一体化获取技术研究

国家自然科学基金

0+阅读 · 2012年12月31日

全相位双正交变换及其在图像处理中的应用研究

国家自然科学基金

0+阅读 · 2012年12月31日

基于重影成像模型的单帧图像三维重建技术及其应用研究

国家自然科学基金

0+阅读 · 2012年12月31日

经验模式分解及其应用于人脸图像光照预处理的几个关键问题研究

国家自然科学基金

0+阅读 · 2012年12月31日

属性迁移学习及其在面部几何与行为数据分析中的应用

国家自然科学基金

0+阅读 · 2012年12月31日

体数据的特征抽取与光照增强绘制方法

国家自然科学基金

0+阅读 · 2012年12月31日

三维模型检索中的语义类视图技术研究

国家自然科学基金

0+阅读 · 2012年12月31日

基于三维差时投影法的超分辨率车辆重建算法研究

国家自然科学基金

0+阅读 · 2010年12月31日

基于流形理论的人脸识别方法研究

国家自然科学基金

0+阅读 · 2009年12月31日

基于流形学习理论的图像搜索技术研究

国家自然科学基金

0+阅读 · 2008年12月31日

Enhanced Training of Query-Based Object Detection via Selective Query Recollection

Arxiv

0+阅读 · 2022年12月15日

FIS-GAN: GAN with Flow-based Importance Sampling

Arxiv

0+阅读 · 2022年12月14日

SAIF: Sparse Adversarial and Interpretable Attack Framework

Arxiv

0+阅读 · 2022年12月14日

GAN Inversion: A Survey

Arxiv

19+阅读 · 2021年1月14日

Data Augmentation for Graph Neural Networks

Arxiv

38+阅读 · 2020年12月2日

已删除

Arxiv

32+阅读 · 2020年3月23日

Self-training with Noisy Student improves ImageNet classification

Arxiv

15+阅读 · 2019年11月11日

Graph Convolutional Label Noise Cleaner: Train a Plug-and-play Action Classifier for Anomaly Detection

Arxiv

15+阅读 · 2019年3月18日

How convolutional neural network see the world - A survey of convolutional neural network visualization methods

Arxiv

11+阅读 · 2018年4月30日

Generative Adversarial Autoencoder Networks

Arxiv

11+阅读 · 2018年3月23日

VIP会员