方法-PC端远程调试分布式训练

2023-12-13 15:39:30

本专栏为深度学习的一些技巧,方法和实验测试,偏向于实际应用,后续不断更新,感兴趣童鞋可关,方便后续推送

简介

一些简单的代码我们使用Pycharm本地调试就能运行成功,但在诸如使用GPU进行分布式训练和推断等场景中,由于我们本地的电脑没有GPU或者没有多块GPU而无法运行这些程序。如果此时我们手头恰好有自己/公司/学校的GPU服务器资源,我们就可以使用这些GPU服务器进行远程调试/运行,无需本地运行代码。

方法

root权限下,软链接

 ln -s /home/xxx/anaconda3/envs/xxx/lib/pythonx.x/site-packages/torch/bin/launch.py pathto{'code_mapping'}
 或者
  ln -s /home/xxx/anaconda3/envs/xxx/bin/torchrun pathto{'code_mapping'}

●拷贝到本地映射路径下
在pycharm depolyment选项中把远程路径下载至本地路径
●配置pycharm运行参数
在这里插入图片描述
●注意:单GPU可以远程Debug,多GPU远程调试会有问题

文章来源:https://blog.csdn.net/zwhdldz/article/details/134972230
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。