diff --git a/.github/workflows/serverless-model-tests.yml b/.github/workflows/serverless-model-tests.yml index 6fd4c1e..cb18ddd 100644 --- a/.github/workflows/serverless-model-tests.yml +++ b/.github/workflows/serverless-model-tests.yml @@ -48,7 +48,7 @@ jobs: - name: Run serverless e2e test id: e2e_test - run: python scripts/serverless_e2e_test.py --config configs/qwen/qwen3_8b.yaml --build + run: python scripts/serverless_e2e_test.py --config configs/gpt-oss/gpt_oss_120b.yaml --build env: RUNPOD_API_KEY: ${{ secrets.RUNPOD_API_KEY_2 }} DOCKERHUB_REPO: ${{ vars.DOCKERHUB_REPO || 'runpod' }} diff --git a/configs/gemma/gemma4_31b_it.yaml b/configs/gemma/gemma4_31b_it.yaml index eaab1c3..2966736 100644 --- a/configs/gemma/gemma4_31b_it.yaml +++ b/configs/gemma/gemma4_31b_it.yaml @@ -8,4 +8,5 @@ kv-cache-dtype: fp8 enforce-eager: false enable-prefix-caching: true enable-chunked-prefill: true +vllm-release: v2.22.5 speculative-config: '{"model":"RedHatAI/gemma-4-31B-it-speculator.eagle3","method":"eagle3","num_speculative_tokens":3}' diff --git a/configs/llama/llama3.1_8b_instruct.yaml b/configs/llama/llama3.1_8b_instruct.yaml index 76136e2..12387c6 100644 --- a/configs/llama/llama3.1_8b_instruct.yaml +++ b/configs/llama/llama3.1_8b_instruct.yaml @@ -6,5 +6,6 @@ trust-remote-code: true quantization: fp8 kv-cache-dtype: fp8 enforce-eager: false +vllm-release: v2.22.5 enable-prefix-caching: true speculative-config: '{"model":"RedHatAI/Llama-3.1-8B-Instruct-speculator.eagle3","method":"eagle3","num_speculative_tokens":3}'