chrisvela and GitHub
69646b9e99
Merge pull request #294 from runpod-workers/feat/allow-config
...
Release / release (push) Waiting to run
feat: allow config.yaml like vllm serve
2026-06-02 20:28:02 -05:00
velaraptor-runpod
80072047ab
feat: allow config.yaml like vllm serve
2026-05-29 15:50:22 -05:00
chrisvela and GitHub
50aba8fb57
Merge pull request #293 from runpod-workers/fix/update-deep-gemm-hub-value
...
Release / release (push) Waiting to run
fix: update VLLM_USE_DEEP_GEMM hub to default to 0
2026-05-27 11:51:48 -05:00
velaraptor-runpod
9edc5715ce
fix: update configuration.md
2026-05-27 11:33:37 -05:00
velaraptor-runpod
4c91f2c5b5
fix: update VLLM_USE_DEEP_GEMM hub to default to 0
2026-05-27 11:26:52 -05:00
chrisvela and GitHub
6265b99348
Merge pull request #288 from runpod-workers/feat/0.20.0
...
feat: update to 0.20.2
2026-05-26 17:17:45 -05:00
velaraptor-runpod
026f8d700b
fix: specify deepgemm commit version
2026-05-21 18:46:54 -05:00
chrisvela and GitHub
146bdb0252
Merge branch 'main' into feat/0.20.0
2026-05-21 16:04:39 -05:00
velaraptor-runpod
da01193a3d
chore: fix readme
2026-05-21 15:57:40 -05:00
velaraptor-runpod
c2e6cc9f61
chore: update readme with correct vllm version
2026-05-21 15:39:19 -05:00
velaraptor-runpod
69968a6b39
chore: fix logging, warning for text prompt
2026-05-21 15:34:09 -05:00
velaraptor-runpod
32b29d4c6c
fix: add deepgemm, update base image and hub for cuda 13.0
2026-05-20 17:43:42 -05:00
velaraptor-runpod
dcea4fc4f9
fix dockerfile
2026-05-15 12:08:31 -04:00
velaraptor-runpod
9c139e8ceb
update: update to 0.20.1, update dockerfile to cuda 13
2026-05-15 11:35:53 -04:00
velaraptor-runpod
678bb4be8f
feat: update to 0.20.1 for patch fixes
2026-05-07 11:58:22 -05:00
chrisvela and GitHub
87d7365126
Merge pull request #292 from runpod-workers/fix/open-ai
...
Release / release (push) Waiting to run
fix: fix warmup
2026-05-01 18:06:11 -05:00
velaraptor-runpod
0e83616f93
fix: fix warmup
2026-05-01 17:39:51 -05:00
chrisvela and GitHub
ab6d39dcf8
Merge pull request #291 from runpod-workers/bug/281-hf-token
...
Release / release (push) Waiting to run
bug: fix hf-token being passed in engineargs
2026-05-01 15:32:04 -05:00
velaraptor-runpod
ed315a175e
merge main
2026-05-01 15:28:05 -05:00
velaraptor-runpod
73f030ae5e
Merge branch 'main' into bug/281-hf-token
2026-05-01 14:33:51 -05:00
chrisvela and GitHub
8a099c1723
Merge pull request #287 from runpod-workers/feat/0.19.1
...
feat: update to 0.19.1
2026-05-01 14:29:39 -05:00
velaraptor-runpod
ff87840a58
fix: add enforce_eager as true, add pytorch_alloc_conf to expandle_segments to True for OOM, for hub defaults
2026-05-01 14:13:03 -05:00
velaraptor-runpod
7dc853b1fe
chore: remove release to trigger on release publish, just use tags. duplicate
2026-05-01 10:13:32 -05:00
velaraptor-runpod
a8b754b92a
merge main
2026-05-01 10:12:43 -05:00
chrisvela and GitHub
6357aeda51
Merge pull request #290 from runpod-workers/fix/fix-old-actions
...
Release / release (push) Waiting to run
fix: fix old github actions, trigger release on publish release
2026-05-01 10:01:22 -05:00
velaraptor-runpod
0140b29c44
chore: add release notes to slack notification
2026-05-01 09:48:43 -05:00
velaraptor-runpod
0cb8aeae77
chore: add specific runpod version
2026-05-01 09:47:23 -05:00
chrisvela and GitHub
cd8f9e9560
Merge branch 'main' into fix/fix-old-actions
2026-04-30 21:57:45 -05:00
chrisvela and GitHub
895fd25fac
Merge pull request #286 from runpod-workers/feat/0.18.1
...
feat: update vllm to 0.18.1
2026-04-30 21:56:07 -05:00
velaraptor-runpod
7bb8df73af
bug: fix hf-token being passed in engineargs
2026-04-30 20:37:30 -05:00
velaraptor-runpod
747cdf5891
chore: update readme vllm version
2026-04-30 20:26:23 -05:00
velaraptor-runpod
3d4af5df9b
chore: update readme vllm version
2026-04-30 20:25:35 -05:00
velaraptor-runpod
72547aa3bb
chore: update readme vllm version
2026-04-30 20:25:02 -05:00
velaraptor-runpod
577fd8c3c3
fix: fix old github actions, trigger release on publish release
2026-04-30 20:22:24 -05:00
chrisvela and GitHub
f49f35456e
Merge pull request #285 from runpod-workers/feat/0.17.1
...
feat: update vllm to 0.17.1
2026-04-30 20:05:45 -05:00
chrisvela and GitHub
cff7b09ef2
Merge pull request #289 from runpod-workers/feat/add-notifications
...
feat: add notifications for new prs, issues, and new releases of vllm
2026-04-30 20:03:48 -05:00
velaraptor-runpod
04b342c675
fix permissions
2026-04-30 20:00:48 -05:00
velaraptor-runpod
5b29643799
feat: add notifications for new prs, issues, and new releases of vllm
2026-04-30 19:55:29 -05:00
velaraptor-runpod
4f8a16df5d
fix: update transformers to >=5
2026-04-30 19:41:09 -05:00
velaraptor-runpod and Claude Sonnet 4.6
22356ee2b3
feat: upgrade vLLM to 0.20.0
...
- Bump vllm[flashinfer] to 0.20.0 in Dockerfile
- Remove io_processor param from OpenAIServingRender (dropped in 0.20.0)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com >
2026-04-30 18:39:07 -05:00
velaraptor-runpod and Claude Sonnet 4.6
fa42ecd79a
fix: resolve lowercase HF cache paths when MODEL_NAME uses original casing
...
Fixes FDE-174. Some model stores (e.g. RunPod pre-cached network volumes)
normalize repo IDs to lowercase. HuggingFace Hub caches using the original
casing, so MODEL_NAME=Qwen/Qwen2.5-Coder-32B-Instruct-AWQ would miss a
cache stored as models--qwen--qwen2.5-coder-32b-instruct-awq/ and attempt
a redundant download that fails on limited container storage.
If the exact-case HF cache directory is absent but a lowercase variant
exists, the latest snapshot path is returned directly so vLLM loads from
disk. Absolute paths and models with no lowercase cache are unchanged.
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com >
2026-04-30 17:54:14 -05:00
velaraptor-runpod and Claude Sonnet 4.6
178c72238e
fix: surface LORA_MODULES parse failures instead of silently loading zero adapters
...
Fixes FDE-194. Previously a malformed LORA_MODULES value was swallowed at
info level and the engine would start with no LoRA adapters, causing 500s
on any request using an adapter model name (e.g. npc-sim-*).
Changes:
- Log at error level when LORA_MODULES cannot be parsed as JSON
- Log at error level when individual adapter dicts fail LoRAModulePath validation
- Log a final error when all adapters fail to load so the cause is obvious
- Accept a single adapter dict (not just an array) for convenience
- Return early when LORA_MODULES is unset to skip unnecessary parsing
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com >
2026-04-30 17:49:09 -05:00
velaraptor-runpod and Claude Sonnet 4.6
e6950bdebd
feat: upgrade vLLM to 0.19.1
...
- Bump vllm[flashinfer] to 0.19.1 in Dockerfile
- Add OpenAIServingRender (new required dependency in 0.19.x serving layer)
- Pass openai_serving_render to all four serving class constructors
- Remove log_error_stack param (removed upstream in 0.19.x)
Co-Authored-By: Claude Sonnet 4.6 <noreply@anthropic.com >
2026-04-30 17:41:11 -05:00
velaraptor-runpod
a774cefe85
fix: clean workspace file
2026-04-30 17:29:00 -05:00
velaraptor-runpod
9de17d49b7
feat: update vllm to 0.18.1
2026-04-30 17:25:23 -05:00
velaraptor-runpod
296556a6f7
feat: update vllm to 0.17.1
2026-04-30 17:21:03 -05:00
chrisvela and GitHub
a1544ea70d
Merge pull request #277 from runpod-workers/feat/lmcache
...
feat: uv installer, LMCache support, add /v1/responses and /v1/messages endpoints
2026-04-28 19:44:00 -03:00
velaraptor-runpod
1ed25eea20
update readme with responses and messages routes
2026-04-16 15:30:30 -05:00
velaraptor-runpod
dc4ad7ddeb
fix: kv_transfer_config is dataclass not json, fix for env var
2026-04-09 14:33:11 -05:00
velaraptor-runpod
9035b0e07f
fix: lmcache version
2026-04-09 14:32:19 -05:00
velaraptor-runpod
c979f0020f
update readmes on TRANSFORMERS_VERSION
2026-04-06 16:54:08 -05:00
velaraptor-runpod
6fbd480a26
fix: allow for transformers_version
2026-04-06 16:49:32 -05:00
velaraptor-runpod
3ef1fb8e7b
requested changes
2026-04-03 15:53:40 -05:00
velaraptor-runpod
30e8514d63
Runpod not RunPod
2026-03-17 20:59:52 -05:00
velaraptor-runpod
d9808815ee
feat: update requirements.txt
2026-03-17 19:56:39 -05:00
velaraptor-runpod
d8ed3b5353
feat: update 0.16.0, add lmcache
2026-03-17 19:54:11 -05:00
velaraptor-runpod
4c4e039565
feat: add messages route for anthropic/claude
2026-03-17 19:51:50 -05:00
chrisvela and GitHub
9d1686960d
Merge pull request #273 from runpod-workers/bug/hf-overides-rope-scaling
...
bug: fix rope scaling to be forward compatible from hf_overrides
2026-03-10 11:21:44 -05:00
velaraptor-runpod
45d1eeee47
bug: fix rope scaling to be forward compatible from hf_overrides
2026-03-06 15:34:11 -06:00
chrisvela and GitHub
17efb0e7d0
Merge pull request #272 from runpod-workers/feat/vllm-0.16.0
...
Release / release (push) Waiting to run
feat: Update to 0.16.0
2026-03-05 13:06:45 -06:00
velaraptor-runpod
2b5f07df63
feat: Update to 0.16.0, remove NUM_GPU_BLOCKS_OVERRIDE in hub default since 0 will break
2026-03-04 16:38:40 -06:00
chrisvela and GitHub
13fa71878e
Merge pull request #269 from runpod-workers/feat/allow-engine-args-env
...
Release / release (push) Waiting to run
feat: allow all AsyncEngineArgs as env vars
2026-02-27 15:34:23 -06:00
velaraptor-runpod
8a9365bed4
remove DEFAULT_ARGS that are none, fix MAX_CONTEXT_LEN_TO_CAPTURE
2026-02-27 14:04:15 -06:00
velaraptor-runpod
cd485a1af1
update readme
2026-02-25 22:57:17 -06:00
velaraptor-runpod
b9043639e9
requested changes/refactor
2026-02-25 16:07:38 -06:00
chrisvela and GitHub
407dbd7773
Merge pull request #270 from runpod-workers/feat/update-vllm-v0.15.1
...
feat: update vllm to 0.15.1
2026-02-25 15:35:58 -06:00
velaraptor-runpod
f103c142c1
feat: update vllm to 0.15.1
2026-02-24 17:44:49 -06:00
velaraptor-runpod
efb093e198
add as VLLM_RUNPOD prefix and update readme
2026-02-24 17:37:57 -06:00
velaraptor-runpod
42443f735e
feat: allow engine args through VLLM_ and checks the engine args
2026-02-24 16:05:18 -06:00
chrisvela and GitHub
b7c6d4f9a2
feat: update dockerfile to 12.9.1 ( #267 )
...
Release / release (push) Waiting to run
* feat: update dockerfile to 12.9.1
* update readme on VLLM_NIGHTLY build arg
2026-02-19 10:13:14 +01:00
chrisvela and GitHub
d69cc021e8
Merge pull request #268 from runpod-workers/fix/spec-config-0-to-none
...
Release / release (push) Waiting to run
fix: spec config env vars should be none if zero
2026-02-18 15:51:51 -06:00
velaraptor-runpod
61faa8f137
fix: spec config env vars should be none if zero
2026-02-18 15:41:19 -06:00
chrisvela and GitHub
1606cff557
Merge pull request #265 from runpod-workers/fix/zero-max-model-num_batches
...
Release / release (push) Waiting to run
fix: check for zero param and set to None
2026-02-13 15:26:06 -06:00
velaraptor-runpod
e705c9494b
fix: check for zero param and set to None
2026-02-13 15:23:54 -06:00
chrisvela and GitHub
b749aa5718
Merge pull request #264 from runpod-workers/fix/max_num_batched_tokens
...
Release / release (push) Waiting to run
fix: max num batched tokens
2026-02-13 12:38:01 -06:00
velaraptor-runpod
4705ba8a7c
fix: check max_num_batched_tokenz if max_model_len not set
2026-02-13 03:29:52 -06:00
velaraptor-runpod
767c66c301
make minimal changes
2026-02-13 03:23:44 -06:00
velaraptor-runpod
fefdbe21a9
update changes
2026-02-13 03:16:43 -06:00
velaraptor-runpod
ee961ad28d
Update hub.json
2026-02-13 03:08:19 -06:00
velaraptor-runpod
2e8c251447
Merge branch 'main' into feat/update-vllm-v0.15.0
2026-02-13 03:01:05 -06:00
velaraptor-runpod
c3cf43b228
Update hub.json
2026-02-13 00:22:16 -06:00
velaraptor-runpod
7ec10b98cd
Update utils.py
2026-02-12 15:28:31 -06:00
velaraptor-runpod
340bc0b3c6
fix: served model name
2026-02-10 21:42:58 -06:00
velaraptor-runpod
e1e9ef74ad
add changes from pr
2026-02-06 18:10:09 -06:00
velaraptor-runpod
461f89cea6
add torch-c-dlpack-ext requirement
2026-02-06 17:03:39 -06:00
velaraptor-runpod
8eb55b90c1
add changes for v0.15.0
2026-02-05 17:24:16 -06:00
chrisvela and GitHub
3851d53f93
add ENABLE_EXPERT_PARALLEL engine arg for MoE models ( #239 )
...
Release / release (push) Waiting to run
* enable expert parallel arg for moe models
* add ENABLE_EXPERT_PARALLEL to hub config
2025-11-17 19:25:19 +01:00