Merge pull request #157 from runpod-workers/m-c
Enabling model caching.
This commit is contained in:
@@ -24,7 +24,10 @@ class vLLMEngine:
|
||||
def __init__(self, engine = None):
|
||||
load_dotenv() # For local development
|
||||
self.engine_args = get_engine_args()
|
||||
if os.getenv("MODEL_CACHE_ENABLE"):
|
||||
self.engine_args.model = f"/runpod/cache/model/{os.getenv('MODEL_NAME')}/main"
|
||||
logging.info(f"Engine args: {self.engine_args}")
|
||||
|
||||
self.tokenizer = TokenizerWrapper(self.engine_args.tokenizer or self.engine_args.model,
|
||||
self.engine_args.tokenizer_revision,
|
||||
self.engine_args.trust_remote_code)
|
||||
|
||||
Reference in New Issue
Block a user