Revert "Enabling model caching."

This commit is contained in:
Marut Pandya
2025-02-18 10:45:47 -08:00
committed by GitHub
parent d7e9c49fe4
commit 2b1d618287
-3
View File
@@ -24,10 +24,7 @@ class vLLMEngine:
def __init__(self, engine = None):
load_dotenv() # For local development
self.engine_args = get_engine_args()
if os.getenv("MODEL_CACHE_ENABLE"):
self.engine_args.model = f"/runpod/cache/model/{os.getenv('MODEL_NAME')}/main"
logging.info(f"Engine args: {self.engine_args}")
self.tokenizer = TokenizerWrapper(self.engine_args.tokenizer or self.engine_args.model,
self.engine_args.tokenizer_revision,
self.engine_args.trust_remote_code)