diff --git a/runs/frontier-s3-real-v0/run_full_real.sh b/runs/frontier-s3-real-v0/run_full_real.sh index 1b20fa7..c4b31b2 100644 --- a/runs/frontier-s3-real-v0/run_full_real.sh +++ b/runs/frontier-s3-real-v0/run_full_real.sh @@ -13,7 +13,7 @@ SERVED_MODEL="qwen3-30b-s3-real-full" MAX_MODEL_LEN="${MAX_MODEL_LEN:-40960}" ALLOW_SYNTHETIC_PROMPTS="${ALLOW_SYNTHETIC_PROMPTS:-false}" ALLOW_LONG_CONTEXT_SERVER="${ALLOW_LONG_CONTEXT_SERVER:-false}" -FLASHINFER_WORKSPACE_BASE="/tmp/wjh/flashinfer-frontier-s3-real-v0-${RHO}-${CONFIG}-t${TRIAL}" +FLASHINFER_WORKSPACE_BASE="${FLASHINFER_WORKSPACE_BASE:-/tmp/wjh/flashinfer-frontier-s3-real-v0-${CONFIG}}" SERVER_PID="" TELEMETRY_PID="" @@ -45,6 +45,9 @@ if (( MAX_MODEL_LEN > 40960 )) && [[ "${ALLOW_LONG_CONTEXT_SERVER}" != "true" ]] echo "ERROR: MAX_MODEL_LEN>40960 requires ALLOW_LONG_CONTEXT_SERVER=true" >&2 exit 1 fi +if (( MAX_MODEL_LEN > 40960 )); then + export VLLM_CACHE_ROOT="${VLLM_CACHE_ROOT:-/tmp/wjh/vllm-cache-frontier-s3-real-longctx}" +fi TRACE_INPUT_ROOT="${TRACE_INPUT_ROOT:-${CONTROL_ROOT}/inputs/${INPUT_NAME}}" REQUESTS_FILE="${TRACE_INPUT_ROOT}/real_requests.jsonl"