including env variable for tensor parallelism / multi-gpu

This commit is contained in:
Jorg Doku
2023-08-09 10:37:43 -05:00
parent 72be7ff31d
commit 3ab0770b1b
+4 -1
View File
@@ -17,12 +17,15 @@ TOKENIZER = os.environ.get('TOKENIZER', None)
if not MODEL_NAME:
print("Error: The model has not been provided.")
# Tensor parallelism
TENSOR_PARALLEL_SIZE = os.environ.get('TENSOR_PARALLEL_SIZE', 1)
# Prepare the engine's arguments
engine_args = AsyncEngineArgs(
model=f"{MODEL_BASE_PATH}{MODEL_NAME.split('/')[1]}",
tokenizer=TOKENIZER,
tokenizer_mode="auto",
tensor_parallel_size=1,
tensor_parallel_size=TENSOR_PARALLEL_SIZE,
dtype="auto",
seed=0,
worker_use_ray=False,