diff --git a/Dockerfile b/Dockerfile index 1f05b31..6e55e64 100644 --- a/Dockerfile +++ b/Dockerfile @@ -10,7 +10,7 @@ RUN ldconfig /usr/local/cuda-12.9/compat/ # Install vLLM with FlashInfer - use CUDA 12.9 PyTorch wheels RUN uv pip install --system "packaging>=24.2" && \ - uv pip install --system "vllm[flashinfer]==0.19.1" --extra-index-url https://download.pytorch.org/whl/cu129 + uv pip install --system "vllm[flashinfer]==0.20.0" --extra-index-url https://download.pytorch.org/whl/cu129 # Install additional Python dependencies (after vLLM to avoid PyTorch version conflicts) COPY builder/requirements.txt /requirements.txt diff --git a/src/engine.py b/src/engine.py index 80bf72b..0fa60c9 100644 --- a/src/engine.py +++ b/src/engine.py @@ -285,7 +285,6 @@ class OpenAIvLLMEngine(vLLMEngine): self.openai_serving_render = OpenAIServingRender( model_config=self.llm.model_config, renderer=self.llm.renderer, - io_processor=self.llm.io_processor, model_registry=self.serving_models.registry, request_logger=None, chat_template=chat_template,