Extend serving rotary cache for code context
This commit is contained in:
@@ -80,6 +80,7 @@ setsid "${VENV_ROOT}/bin/vllm" serve "${MODEL_ROOT}" \
|
||||
--served-model-name "${SERVED_MODEL}" \
|
||||
--tensor-parallel-size 4 \
|
||||
--gpu-memory-utilization 0.92 \
|
||||
--hf-overrides "{\"max_position_embeddings\":${MAX_MODEL_LEN}}" \
|
||||
--max-model-len "${MAX_MODEL_LEN}" \
|
||||
--max-num-batched-tokens 8192 \
|
||||
--max-num-seqs 16 \
|
||||
|
||||
Reference in New Issue
Block a user