diff --git a/src/engine_args.py b/src/engine_args.py index ce352c4..4e370c8 100644 --- a/src/engine_args.py +++ b/src/engine_args.py @@ -91,6 +91,7 @@ DEFAULT_ARGS = { "disable_logprobs_during_spec_decoding": os.getenv('DISABLE_LOGPROBS_DURING_SPEC_DECODING', None), "otlp_traces_endpoint": os.getenv('OTLP_TRACES_ENDPOINT', None), "use_v2_block_manager": os.getenv('USE_V2_BLOCK_MANAGER', 'true'), + "limit_mm_per_prompt": convert_limit_mm_per_prompt(os.getenv('LIMIT_MM_PER_PROMPT', "image=1")), } def match_vllm_args(args): diff --git a/worker-config.json b/worker-config.json index 27173e8..ec2f239 100644 --- a/worker-config.json +++ b/worker-config.json @@ -86,7 +86,7 @@ "TYPICAL_ACCEPTANCE_SAMPLER_POSTERIOR_THRESHOLD", "TYPICAL_ACCEPTANCE_SAMPLER_POSTERIOR_ALPHA", "MODEL_LOADER_EXTRA_CONFIG", "PREEMPTION_MODE", "PREEMPTION_CHECK_PERIOD", "PREEMPTION_CPU_CAPACITY", "MAX_LOG_LEN", "DISABLE_LOGGING_REQUEST", - "ENABLE_AUTO_TOOL_CHOICE", "TOOL_CALL_PARSER" + "ENABLE_AUTO_TOOL_CHOICE", "TOOL_CALL_PARSER", "LIMIT_MM_PER_PROMPT" ] }, { @@ -1324,6 +1324,14 @@ { "value": "pythonic", "label": "Pythonic" }, { "value": "internlm", "label": "InternLM" } ] + }, + "LIMIT_MM_PER_PROMPT": { + "env_var_name": "LIMIT_MM_PER_PROMPT", + "value": "image=1", + "title": "Limit MM Per Prompt", + "description": "Limit MM per prompt", + "required": false, + "type": "text" } } }