From d5bb9745f8ae0e9f6fee9ff4f4b6e311ca540fb7 Mon Sep 17 00:00:00 2001 From: Gahow Wang Date: Fri, 24 Jul 2026 01:50:17 +0800 Subject: [PATCH] Reuse host-local caches for long-context replay --- runs/frontier-s3-real-v0/run_full_real.sh | 5 ++++- 1 file changed, 4 insertions(+), 1 deletion(-) diff --git a/runs/frontier-s3-real-v0/run_full_real.sh b/runs/frontier-s3-real-v0/run_full_real.sh index 1b20fa7..c4b31b2 100644 --- a/runs/frontier-s3-real-v0/run_full_real.sh +++ b/runs/frontier-s3-real-v0/run_full_real.sh @@ -13,7 +13,7 @@ SERVED_MODEL="qwen3-30b-s3-real-full" MAX_MODEL_LEN="${MAX_MODEL_LEN:-40960}" ALLOW_SYNTHETIC_PROMPTS="${ALLOW_SYNTHETIC_PROMPTS:-false}" ALLOW_LONG_CONTEXT_SERVER="${ALLOW_LONG_CONTEXT_SERVER:-false}" -FLASHINFER_WORKSPACE_BASE="/tmp/wjh/flashinfer-frontier-s3-real-v0-${RHO}-${CONFIG}-t${TRIAL}" +FLASHINFER_WORKSPACE_BASE="${FLASHINFER_WORKSPACE_BASE:-/tmp/wjh/flashinfer-frontier-s3-real-v0-${CONFIG}}" SERVER_PID="" TELEMETRY_PID="" @@ -45,6 +45,9 @@ if (( MAX_MODEL_LEN > 40960 )) && [[ "${ALLOW_LONG_CONTEXT_SERVER}" != "true" ]] echo "ERROR: MAX_MODEL_LEN>40960 requires ALLOW_LONG_CONTEXT_SERVER=true" >&2 exit 1 fi +if (( MAX_MODEL_LEN > 40960 )); then + export VLLM_CACHE_ROOT="${VLLM_CACHE_ROOT:-/tmp/wjh/vllm-cache-frontier-s3-real-longctx}" +fi TRACE_INPUT_ROOT="${TRACE_INPUT_ROOT:-${CONTROL_ROOT}/inputs/${INPUT_NAME}}" REQUESTS_FILE="${TRACE_INPUT_ROOT}/real_requests.jsonl"