diff --git a/runs/frontier-code-trace-v0/run_max_model_len_smoke.sh b/runs/frontier-code-trace-v0/run_max_model_len_smoke.sh index 0987482..4d66656 100755 --- a/runs/frontier-code-trace-v0/run_max_model_len_smoke.sh +++ b/runs/frontier-code-trace-v0/run_max_model_len_smoke.sh @@ -80,6 +80,7 @@ setsid "${VENV_ROOT}/bin/vllm" serve "${MODEL_ROOT}" \ --served-model-name "${SERVED_MODEL}" \ --tensor-parallel-size 4 \ --gpu-memory-utilization 0.92 \ + --hf-overrides "{\"max_position_embeddings\":${MAX_MODEL_LEN}}" \ --max-model-len "${MAX_MODEL_LEN}" \ --max-num-batched-tokens 8192 \ --max-num-seqs 16 \ diff --git a/runs/frontier-s3-real-v0/run_full_real.sh b/runs/frontier-s3-real-v0/run_full_real.sh index 916ae2a..1b20fa7 100644 --- a/runs/frontier-s3-real-v0/run_full_real.sh +++ b/runs/frontier-s3-real-v0/run_full_real.sh @@ -152,13 +152,16 @@ PY export TOKENIZERS_PARALLELISM=false VLLM_USE_V1=1 TORCH_CUDA_ARCH_LIST=9.0 PREFIX_CACHING=true export HF_HUB_OFFLINE=1 TRANSFORMERS_OFFLINE=1 FLASHINFER_WORKSPACE_BASE +HF_OVERRIDE_ARGS=() if [[ "${ALLOW_LONG_CONTEXT_SERVER}" == "true" ]]; then export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 + HF_OVERRIDE_ARGS=(--hf-overrides "{\"max_position_embeddings\":${MAX_MODEL_LEN}}") fi ulimit -n 65536 setsid "${VENV_ROOT}/bin/vllm" serve "${MODEL_ROOT}" \ --host 127.0.0.1 --port "${PORT}" --served-model-name "${SERVED_MODEL}" \ --tensor-parallel-size "${TP}" --gpu-memory-utilization 0.92 \ + "${HF_OVERRIDE_ARGS[@]}" \ --max-model-len "${MAX_MODEL_LEN}" --max-num-batched-tokens 8192 --max-num-seqs "${MNS}" \ --enable-prefix-caching --block-size 16 --enable-chunked-prefill --no-enable-log-requests \ --enable-logging-iteration-details \