作者丨 科技 猛兽
编辑丨极市平台
这篇文章从应用的角度出发,介绍 DP 和 DDP 分别在什么情况下使用,以及各自的使用方法。以及 DDP 的保存和加载模型的策略,和如何同时使用 DDP 和模型并行 (model parallel)。
PyTorch 提供了几种并行训练的选项。
Data Parallel 这种方法允许我们以最小的代码修改代价实现有1台机器上的多张 GPU 的训练。只需要修改1行代码。但是尽管 Data Parallel 这种方法使用方便,但是 Data Parallel 的性能却不是最好的。我们先介绍下 torch.nn.DataParallel 这个 PyTorch class。
定义:
CLASS torch.nn.DataParallel (module,device_ids=None,output_device=None,dim=0)
torch.nn.DataParallel 要输入一个 module ,在前向传播过程中,这个 module 会在每个 device 上面复制一份。同时输入数据在 batch 这个维度被分块,这些数据会被按块分配在不同的 device 上面。最后形成的局面就是:所有的 GPU 上面都有一样的 module ,每个 GPU 都有单独的数据。在反向传播过程中,每一个 GPU 上得到的 gradient 会汇总到主 GPU (server) 上面。主 GPU (server) 更新参数之后,还会把新的参数模型参数 broadcast 到每个其它的 GPU 上面。
DP 使用的是 Parameter Server (PS) 架构。 Parameter Server 架构 (PS 模式) 由 server 节点和 worker 节点组成,server 节点的主要功能是初始化和保存模型参数、接受 worker 节点计算出的局部梯度、汇总计算全局梯度,并更新模型参数。
worker 节点的主要功能是各自保存部分训练数据,初始化模型,从 server 节点拉取最新的模型参数 (pull),再读取参数,根据训练数据计算局部梯度,上传给 server 节点 (push)。
PS 模式下的 DP,会造成负载不均衡,因为充当 server 的 GPU 需要一定的显存用来保存 worker 节点计算出的局部梯度;另外 server 还需要将更新后的模型参数 broadcast 到每个 worker,server 的带宽就成了 server 与worker 之间的通信瓶颈,server 与 worker 之间的通信成本会随着 worker 数目的增加而线性增加。
所以读完了以上的分析,自然而然的2个要求就是:
下面是2条重要的注意信息:
参数定义:
使用:
这一节通过具体的例子展示 DataParallel 的用法。
1) 首先 Import PyTorch modules 和超参数。
2) 设置 device。
3) 制作一个dummy (random) dataset,这里我们只需要实现 getitem 方法。
4) 制作一个示例模型。
5) 创建 Model 和 DataParallel,首先要把模型实例化,再检查下我们是否有多块 GPU。最后是 put model on device:
输出:
6) Run the Model:
输出:
以上就是 DataParellel 的极简示例,注意我们并没有告诉程序我们要使用多少块 GPU,因为 torch.cuda.device_count() 会自动地计算出当前的所有可用的 GPU 数,假设电脑里面是8块,那么输出就会是:
Distributed Data Parallel 这种方法允许我们在有1台或者多台的机器上分布式训练。与 Data Parallel 的不同之处是:
我们先介绍下 torch.nn.parallel.DistributedDataParallel 这个 PyTorch class。
定义:
CLASS torch.nn.parallel.DistributedDataParallel (module,device_ids=None,output_device=None,dim=0,broadcast_buffers=True,process_group=None,bucket_cap_mb=25,find_unused_parameters=False,check_reduction=False,gradient_as_bucket_view=False)
torch.nn.DistributedDataParallel
torch.nn.DataParallel 要输入一个 module ,在模型构建的过程中,这个 module会在每个 device 上面复制一份。同时输入数据在 batch 这个维度被分块,这些数据会被按块分配在不同的 device 上面。最后形成的局面就是:所有的 GPU 上面都有一样的 module,每个 GPU 都有单独的数据。在反向传播过程中,每一个 GPU 上得到的 gradient 会被平均。
使用这个 class 需要 torch.distributed 的初始化,所以需要调用 [torch.distributed.init_process_group()](https://link.zhihu.com/?target=https%3A//pytorch.org/docs/stable/distributed.html%23torch.distributed.init_process_group) 。
如果想在一个有 N 个 GPU 的设备上面使用 DistributedDataParallel,则需要 spawn up N 个进程,每个进程对应0-N-1 的一个 GPU。这可以通过下面的语句实现:
i from 0-N-1,每个进程中都需要:
为了在每台设备 (节点) 上建立多个进程,我们可以使用 torch.distributed.launch 或者 torch.multiprocessing.spawn 。
如果你在一个进程中使用 torch.save 来保存模型,并在其他一些进程中使用 torch.load 来加载模型,请确保每个进程的 map_location 都配置正确。如果没有 map_location,torch.load 会将从保存的设备上加载模型。
几点注意:
参数定义:
这一节通过具体的例子展示 DistributedDataParallel 的用法,这个例子假设我们有一个8卡 GPU。
1) 首先初始化进程:
2) 创建一个 toy module,叫它 ToyModel,用 DDP 去包裹它。注意,由于 DDP 在构造函数中把模型状态从第rank 0 的进程广播给所有其他进程,所以我们无需担心不同的 DDP 进程从不同的参数初始值启动。PyTorch提供了 mp.spawn 来在一个节点启动该节点所有进程,每个进程运行 train(i, args) ,其中 i 从0到 args.gpus - 1 。所以有以下 code。
执行代码时,GPU 数和进程数都是 world_size。
当使用 DDP 时,我们只在一个进程中保存模型,然后将其加载到所有进程中,以减少写的开销。这也很好理解,因为所有进程从相同的参数开始,梯度在后向传递中是同步的,因此,所有进程的梯度是相同的。所以读者请确保所有进程在保存完成之前不要开始加载。此外,在加载模块时,我们需要提供一个适当的 map_location 参数,以防止一个 process 踏入其他进程的设备。如果缺少 map_location,torch.load 将首先把 module 加载到 CPU,然后把每个参数复制到它被保存的地方,这将导致同一台机器上的所有进程使用同一组设备。
有关模型并行的介绍可以参考:
DDP 也适用于 multi-GPU 模型 。DDP 包裹着 multi-GPU 模型 ,在用海量数据训练大型模型时特别有帮助。
当把一个 multi-GPU 模型 传递给 DDP 时,device_ids 和 output_device 不能被设置。输入和输出数据将被应用程序或模型 forward() 方法放在适当的设备中。
参考:
https://pytorch.org/tutorials/beginner/blitz/data_parallel_tutorial.html
https://pytorch.org/docs/stable/notes/ddp.html
最新发布的Pytorch 1.12版别现已支撑对Mac的M1 GPU支撑,能够直接在官网进行选择,运用相应的指令进行下载装链轿置。即运用如下指令进滑悔行装置
pip3 install torch torchvision torchaudio
或许conda指令为:
conda install pytorch torchvision torchaudio -c pytorch
以下是Pytorch 1.12发布时所展现的性能比照,能够看到在训练和验证普遍都快了5-20倍。
运用M1芯片进行加快
要想像运用服务器的GPU上进行深度学习加快,就需要将模型放到GPU上,在服务器中这个 *** 作是经过
device = torch.device("cuda:0")
model = model.to(device)
完成,而MacBook Pro中只需要将cuda改为mps即可,即
device = torch.device("mps")
model = model.to(device)
例如,咱们能够将数据和模型经过指定device的方法生成或许从cpu搬到GPU上,示例代码如下:
import torch
import torchvision
device = torch.device("mps")
x = torch.randn(32, 32, device=device)
model = torchvision.models.resnet18().to(device)
print(x.device)
print(next(model.parameters()).device)
这里的变量x直接经过指定device的方法在mps即M1芯片的GPU上生成,而棚让肆模型resnet18则是从CPU生成后搬到了mps。
1.控制手电筒开关的工具类:
public class FlashUtils {
private CameraManager manager
private Camera mCamera = null
private Context context
private boolean status = false//记录手电筒状态
笑雹 FlashUtils(Context context){
if (Build.VERSION.SDK_INT >= Build.VERSION_CODES.LOLLIPOP) {
manager = (CameraManager) context.getSystemService(Context.CAMERA_SERVICE)
}
this.context = context
}
//打开手电筒
public void open() {
if(status){//如果已经是打开状态,不需要打开
return
}
if (Build.VERSION.SDK_INT >= Build.VERSION_CODES.M) {
try {
manager.setTorchMode("0", true)
} catch (Exception e) {
e.printStackTrace()
}
} else {
PackageManager packageManager = context.getPackageManager()
FeatureInfo[] features = packageManager.getSystemAvailableFeatures()
for (FeatureInfo featureInfo : features) {
if (PackageManager.FEATURE_CAMERA_FLASH.equals(featureInfo.name)) { // 判断设备是否支持闪光灯
if (null == mCamera) {
mCamera = Camera.open()
}
Camera.Parameters parameters = mCamera.getParameters()
parameters.setFlashMode(Camera.Parameters.FLASH_MODE_TORCH)
中升粗 mCamera.setParameters(parameters)
mCamera.startPreview()
卖镇 }
}
}
status = true//记录手电筒状态为打开
}
//关闭手电筒
public void close() {
if(!status){//如果已经是关闭状态,不需要打开
return
}
if (Build.VERSION.SDK_INT >= Build.VERSION_CODES.M) {
try {
manager.setTorchMode("0", false)
} catch (CameraAccessException e) {
e.printStackTrace()
}
} else {
if (mCamera != null) {
mCamera.stopPreview()
mCamera.release()
mCamera = null
}
}
status = false//记录手电筒状态为关闭
}
//改变手电筒状态
public void converse(){
if(status){
close()
}else{
open()
}
}
}
2.使用方法:
FlashUtils utils = new FlashUtils(this)
utils.open()//打开手电筒
// utils.close()//关闭手电筒
3.示例程序已上传:
https://github.com/wkxjc/FlashlightStudy
欢迎分享,转载请注明来源:内存溢出
评论列表(0条)