Gate long-context profile override explicitly
This commit is contained in:
@@ -11,6 +11,7 @@ esac
|
||||
|
||||
OUTPUT_ROOT="${OUTPUT_ROOT:?OUTPUT_ROOT must be set}"
|
||||
MAX_MODEL_LEN="${MAX_MODEL_LEN:-147456}"
|
||||
ALLOW_LONG_CONTEXT_PROFILE="${ALLOW_LONG_CONTEXT_PROFILE:-false}"
|
||||
VENV_ROOT="${VENV_ROOT:-/home/admin/cpfs/wjh/venvs/vllm-0.20.0-cu129-workload-regime-v2}"
|
||||
VLLM_SOURCE="${VLLM_SOURCE:-/home/admin/cpfs/wjh/agentic-kv/third_party/vllm_v20_build}"
|
||||
MODEL="${MODEL:-/home/admin/cpfs/wjh/models/Qwen/Qwen3-30B-A3B}"
|
||||
@@ -42,6 +43,11 @@ test -x "${VENV_ROOT}/bin/python"
|
||||
test -f "${VLLM_SOURCE}/benchmarks/attention_benchmarks/runner.py"
|
||||
test -f "${MODEL}/config.json"
|
||||
test -f "${PROFILE_SCRIPT}"
|
||||
if [[ "${ALLOW_LONG_CONTEXT_PROFILE}" != "true" ]]; then
|
||||
echo "ERROR: set ALLOW_LONG_CONTEXT_PROFILE=true after reviewing the model's 40960-token RoPE contract" >&2
|
||||
exit 1
|
||||
fi
|
||||
export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1
|
||||
|
||||
echo "PROFILE_LAUNCH_ECHO host=$(hostname) gpu=${CUDA_VISIBLE_DEVICES} tp=${TP} max_model_len=${MAX_MODEL_LEN} specs=${BATCH_SPECS[*]}"
|
||||
date -u +"START_UTC=%Y-%m-%dT%H:%M:%SZ"
|
||||
@@ -59,6 +65,8 @@ printf '%s\n' "${BATCH_SPECS[@]}" \
|
||||
> "${OUTPUT_ROOT}/provenance/batch-specs.txt"
|
||||
printf '%s\n' "${MAX_MODEL_LEN}" \
|
||||
> "${OUTPUT_ROOT}/provenance/max-model-len.txt"
|
||||
printf '%s\n' "${VLLM_ALLOW_LONG_MAX_MODEL_LEN}" \
|
||||
> "${OUTPUT_ROOT}/provenance/vllm-allow-long-max-model-len.txt"
|
||||
|
||||
timeout --signal=TERM --kill-after=30s 1800 \
|
||||
"${VENV_ROOT}/bin/python" "${PROFILE_SCRIPT}" \
|
||||
|
||||
Reference in New Issue
Block a user