diff --git a/src/handler.py b/src/handler.py index 0115d2e..4e390be 100644 --- a/src/handler.py +++ b/src/handler.py @@ -15,7 +15,7 @@ MODEL_NAME = os.environ.get('MODEL_NAME') MODEL_BASE_PATH = os.environ.get('MODEL_BASE_PATH', '/runpod-volume/') STREAMING = os.environ.get('STREAMING', False) == 'True' TOKENIZER = os.environ.get('TOKENIZER', None) -USE_FULL_METRICS = os.environ.get('USE_FULL_METRICS', False) +USE_FULL_METRICS = os.environ.get('USE_FULL_METRICS', True) if not MODEL_NAME: print("Error: The model has not been provided.") diff --git a/src/metrics.py b/src/metrics.py index d5f27b3..a0ceae2 100644 --- a/src/metrics.py +++ b/src/metrics.py @@ -68,4 +68,7 @@ def vllm_log_system_stats( 'cpu_kv_cache_usage': cpu_cache_usage, # percentage } + # Print metrics + print(metrics) + self.metrics = metrics