lamiastella icon

.bash inside .slurm is not being run

lamiastella | PRO | 09/14/21 12:13:00 AM UTC | 0 ⭐ | 511 👁️ | Never ⏰ | []
text |

2.76 KB

|

None

|

0 👍

/

0 👎

so, $ sbatch torch_gpu_sanity_venv385-11.slurm runs the stuff inside the .slurm except running the /research/jalal/slurm/torch_gpu_sanity_venv385-11.bash line
[jalal@goku fashion_compatibility]$ cat slurm-28334.out 
Mon Sep 13 20:06:44 EDT 2021 ivcgpu10.bu.edu env
CUDA_HOME=/usr/local/cuda-10.0
BASEPATH=/home/grad3/jalal/.local/bin:/opt/rh/rh-php70/root/bin:/scratch2/system/opt/pycharm-community-2018.1.2/bin:/scratch2/google-cloud-sdk/bin:/scratch2/google-cloud-sdk/bin:/scratch3/.cargo/bin:/home/grad3/jalal/.gdrive-downloader:/usr/local/cuda-10.0/bin:/scratch3/MATLAB/matlab/bin:/home/grad3/jalal/.local/bin:/opt/rh/rh-php70/root/bin:/scratch2/system/opt/pycharm-community-2018.1.2/bin:/scratch2/google-cloud-sdk/bin:/scratch2/google-cloud-sdk/bin:/usr/lib64/qt-3.3/bin:/scratch/sjn-p3/anaconda/anaconda3/condabin:/usr/local/bin:/usr/local/sbin:/usr/bin:/usr/sbin:/bin:/sbin:/usr/local/IT/bin:/usr/bin/python3:/home/grad3/jalal/bin:/scratch/sjn-p2/anaconda/anaconda2/bin
CUDA_DEVICE_ORDER=PCI_BUS_ID
CUDA_VISIBLE_DEVICES=7
PATH=/home/grad3/jalal/.gdrive-downloader:/usr/local/cuda-10.0/bin:/scratch3/MATLAB/matlab/bin:/home/grad3/jalal/.local/bin:/opt/rh/rh-php70/root/bin:/scratch2/system/opt/pycharm-community-2018.1.2/bin:/scratch2/google-cloud-sdk/bin:/scratch2/google-cloud-sdk/bin:/scratch3/.cargo/bin:/home/grad3/jalal/.gdrive-downloader:/usr/local/cuda-10.0/bin:/scratch3/MATLAB/matlab/bin:/home/grad3/jalal/.local/bin:/opt/rh/rh-php70/root/bin:/scratch2/system/opt/pycharm-community-2018.1.2/bin:/scratch2/google-cloud-sdk/bin:/scratch2/google-cloud-sdk/bin:/usr/lib64/qt-3.3/bin:/scratch/sjn-p3/anaconda/anaconda3/condabin:/usr/local/bin:/usr/local/sbin:/usr/bin:/usr/sbin:/bin:/sbin:/usr/local/IT/bin:/usr/bin/python3:/home/grad3/jalal/bin:/scratch/sjn-p2/anaconda/anaconda2/bin:/usr/bin/python3
torch vers =      1.8.1+cu111
tensor([[0.6323, 0.2388, 0.8772],
        [0.6798, 0.7087, 0.4152],
        [0.5309, 0.6991, 0.4273],
        [0.6753, 0.0531, 0.5897],
        [0.8470, 0.7392, 0.3246]])
cuda avail =      True
cuda current dev= 0
dev 0 = NVIDIA RTX A6000
and
[jalal@goku fashion_compatibility]$ cat torch_gpu_sanity_venv385-11.slurm
#!/bin/bash
#SBATCH --partition=gpu-L --gres=gpu:1 
# -------------------------> ask for 1 GPU
d=$(date)
h=$(hostname)
echo $d $h env         # show CUDA related Env vars 
env|grep -i cuda
# nvidia-smi
#          actual work
/research/jalal/slurm/torch_gpu_sanity_venv385-11.bash
and
[jalal@goku fashion_compatibility]$ cat torch_gpu_sanity_venv385-11.bash 
#!/bin/bash
source /research/jalal/slurm/venv/fash/bin/activate
python main.py --name both_attn_1e_SA --learned --l2_embed --datadir ../../data/ --all_attend_fc  --use_attend --epochs 1
deactivate 
does anyone know why the 10th line of the .slurm script is not being run?

Comments