单机多卡训练报错NCCL版本有问题

2024-01-09 22:47:21

在这里插入图片描述
torch.distributedtorch.distributed…DistBackendErrorDistBackendError: : NCCL error in: …/torch/csrc/distributed/c10d/ProcessGroupNCCL.cpp:1275, internal error, NCCL version 2.14.3

这个不知道什么原因,然后解决方法是
增加环境变量NCCL_SOCKET_IFNAME=eth2

文章来源:https://blog.csdn.net/weixin_42896263/article/details/135490530
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。