--- up.sh +++ up.sh @@ -17,5 +17,6 @@ q=$(squeue -u "$USER" -h -n "llm-$NAME" -o '%i %T %N' | tr '\n' ' ') [ -n "$q" ] && { echo "already queued/running: $q"; exit 0; } fi -sbatch --parsable -J "llm-$NAME" -p "$PARTITION" -G "$GPUS" -c "$CPUS" --mem "$MEM" -t "$TIME" \ +# One vLLM process uses local tensor-parallel GPUs; never spread them across nodes. +sbatch --parsable --nodes=1 -J "llm-$NAME" -p "$PARTITION" -G "$GPUS" -c "$CPUS" --mem "$MEM" -t "$TIME" \ -o "$B/logs/$NAME.%j.out" ${AFTER:+--dependency=afterany:$AFTER} "$B/serve.sh" "$NAME"