Add Qwen235 vLLM 0.20 real surface runner

This commit is contained in:
2026-07-19 02:39:16 +08:00
parent c8383c9c4c
commit f4813cf537
2 changed files with 144 additions and 4 deletions

View File

@@ -9,11 +9,16 @@ MNS="${MNS:?MNS is required}"
TRACE_LABEL="${TRACE_LABEL:?TRACE_LABEL is required}"
SERVER_PORT="${SERVER_PORT:?SERVER_PORT is required}"
PREFIX_CACHING="${PREFIX_CACHING:-true}"
ENABLE_EXPERT_PARALLEL="${ENABLE_EXPERT_PARALLEL:-false}"
MODEL_QUANTIZATION="${MODEL_QUANTIZATION:-}"
DISABLE_CUSTOM_ALL_REDUCE="${DISABLE_CUSTOM_ALL_REDUCE:-false}"
GPU_MEMORY_UTILIZATION="${GPU_MEMORY_UTILIZATION:-0.92}"
VENV_ROOT="${VENV_ROOT:-/tmp/wjh/venvs/vllm-0.20.0-cu129-profiler-v1}"
MODEL_ROOT="${MODEL_ROOT:-/home/admin/cpfs/wjh/models/Qwen/Qwen3-30B-A3B}"
FLASHINFER_WORKSPACE_BASE="${FLASHINFER_WORKSPACE_BASE:-/tmp/wjh/flashinfer-workspace-vllm020-profiler-v1}"
SERVER_READY_ATTEMPTS="${SERVER_READY_ATTEMPTS:-120}"
SERVED_MODEL="qwen3-30b-exact-trace"
CLIENT_TIMEOUT_SECONDS="${CLIENT_TIMEOUT_SECONDS:-1800}"
SERVED_MODEL="${SERVED_MODEL:-qwen3-30b-exact-trace}"
EXACT_TRACE_CLIENT="${EXACT_TRACE_CLIENT:-qwen30_exact_trace_client.py}"
SERVER_PID=""
@@ -53,8 +58,23 @@ case "${PREFIX_CACHING}" in
;;
esac
case "${ENABLE_EXPERT_PARALLEL}" in
true) EP_FLAG=(--enable-expert-parallel) ;;
false) EP_FLAG=() ;;
*) echo "ERROR: ENABLE_EXPERT_PARALLEL must be true or false" >&2; exit 1 ;;
esac
case "${DISABLE_CUSTOM_ALL_REDUCE}" in
true) CUSTOM_AR_FLAG=(--disable-custom-all-reduce) ;;
false) CUSTOM_AR_FLAG=() ;;
*) echo "ERROR: DISABLE_CUSTOM_ALL_REDUCE must be true or false" >&2; exit 1 ;;
esac
QUANT_FLAG=()
if [[ -n "${MODEL_QUANTIZATION}" ]]; then
QUANT_FLAG=(--quantization "${MODEL_QUANTIZATION}")
fi
REQUEST_COUNT="$(wc -l < "${REQUESTS_FILE}")"
echo "QWEN30_EXACT_TRACE_REAL_LAUNCH_ECHO host=$(hostname) gpus=${CUDA_VISIBLE_DEVICES} model=${MODEL_ROOT} runtime=vLLM-0.20.0+cu129 dtype=BF16 config=TP${TP}_MNS${MNS}_MBT8192 trace=${TRACE_LABEL} requests=${REQUEST_COUNT} source=${REQUESTS_FILE} arrivals=manifest prefix=${PREFIX_CACHING} block=16 metrics=TTFT,TPOT-if-OSL-gt-1,E2E flashinfer_workspace=${FLASHINFER_WORKSPACE_BASE} output=${OUTPUT_ROOT} ready_budget_s=$((SERVER_READY_ATTEMPTS * 3)) hard_wall=3600s"
echo "EXACT_TRACE_REAL_LAUNCH_ECHO host=$(hostname) gpus=${CUDA_VISIBLE_DEVICES} model=${MODEL_ROOT} runtime=vLLM-0.20.0+cu129 dtype=BF16 quantization=${MODEL_QUANTIZATION:-none} config=TP${TP}_EP${ENABLE_EXPERT_PARALLEL}_MNS${MNS}_MBT8192 trace=${TRACE_LABEL} requests=${REQUEST_COUNT} source=${REQUESTS_FILE} arrivals=manifest prefix=${PREFIX_CACHING} block=16 metrics=TTFT,TPOT-if-OSL-gt-1,E2E flashinfer_workspace=${FLASHINFER_WORKSPACE_BASE} output=${OUTPUT_ROOT} ready_budget_s=$((SERVER_READY_ATTEMPTS * 3)) client_timeout_s=${CLIENT_TIMEOUT_SECONDS}"
date -u +"START_UTC=%Y-%m-%dT%H:%M:%SZ"
sha256sum qwen30_exact_trace_client.py run_qwen30_exact_trace_real_anchor.sh \
../frontier-phase-factorial-v0/qwen30_prefill_client.py \
@@ -74,9 +94,10 @@ ulimit -n 65536
setsid "${VENV_ROOT}/bin/vllm" serve "${MODEL_ROOT}" \
--host 127.0.0.1 --port "${SERVER_PORT}" --served-model-name "${SERVED_MODEL}" \
--tensor-parallel-size "${TP}" --gpu-memory-utilization 0.92 \
--tensor-parallel-size "${TP}" --gpu-memory-utilization "${GPU_MEMORY_UTILIZATION}" \
--max-model-len 40960 --max-num-batched-tokens 8192 --max-num-seqs "${MNS}" \
"${PREFIX_CACHING_FLAG}" --enable-chunked-prefill --no-enable-log-requests \
"${CUSTOM_AR_FLAG[@]}" "${QUANT_FLAG[@]}" "${EP_FLAG[@]}" \
> "${OUTPUT_ROOT}/logs/server.log" 2>&1 &
SERVER_PID=$!
READY=0
@@ -110,7 +131,7 @@ fi
--port "${SERVER_PORT}" --requests-file "${REQUESTS_FILE}" \
--served-model "${SERVED_MODEL}" \
--output "${OUTPUT_ROOT}/results/result.json" --tpot-slo-ms 150 \
--timeout-seconds 1800
--timeout-seconds "${CLIENT_TIMEOUT_SECONDS}"
cleanup
find "${OUTPUT_ROOT}" -type f ! -path '*/provenance/artifacts.sha256' -print0 \