Reuse host-local caches for long-context replay

This commit is contained in:
2026-07-24 01:50:17 +08:00
parent da480a8761
commit d5bb9745f8

View File

@@ -13,7 +13,7 @@ SERVED_MODEL="qwen3-30b-s3-real-full"
MAX_MODEL_LEN="${MAX_MODEL_LEN:-40960}" MAX_MODEL_LEN="${MAX_MODEL_LEN:-40960}"
ALLOW_SYNTHETIC_PROMPTS="${ALLOW_SYNTHETIC_PROMPTS:-false}" ALLOW_SYNTHETIC_PROMPTS="${ALLOW_SYNTHETIC_PROMPTS:-false}"
ALLOW_LONG_CONTEXT_SERVER="${ALLOW_LONG_CONTEXT_SERVER:-false}" ALLOW_LONG_CONTEXT_SERVER="${ALLOW_LONG_CONTEXT_SERVER:-false}"
FLASHINFER_WORKSPACE_BASE="/tmp/wjh/flashinfer-frontier-s3-real-v0-${RHO}-${CONFIG}-t${TRIAL}" FLASHINFER_WORKSPACE_BASE="${FLASHINFER_WORKSPACE_BASE:-/tmp/wjh/flashinfer-frontier-s3-real-v0-${CONFIG}}"
SERVER_PID="" SERVER_PID=""
TELEMETRY_PID="" TELEMETRY_PID=""
@@ -45,6 +45,9 @@ if (( MAX_MODEL_LEN > 40960 )) && [[ "${ALLOW_LONG_CONTEXT_SERVER}" != "true" ]]
echo "ERROR: MAX_MODEL_LEN>40960 requires ALLOW_LONG_CONTEXT_SERVER=true" >&2 echo "ERROR: MAX_MODEL_LEN>40960 requires ALLOW_LONG_CONTEXT_SERVER=true" >&2
exit 1 exit 1
fi fi
if (( MAX_MODEL_LEN > 40960 )); then
export VLLM_CACHE_ROOT="${VLLM_CACHE_ROOT:-/tmp/wjh/vllm-cache-frontier-s3-real-longctx}"
fi
TRACE_INPUT_ROOT="${TRACE_INPUT_ROOT:-${CONTROL_ROOT}/inputs/${INPUT_NAME}}" TRACE_INPUT_ROOT="${TRACE_INPUT_ROOT:-${CONTROL_ROOT}/inputs/${INPUT_NAME}}"
REQUESTS_FILE="${TRACE_INPUT_ROOT}/real_requests.jsonl" REQUESTS_FILE="${TRACE_INPUT_ROOT}/real_requests.jsonl"