Reuse host-local caches for long-context replay
This commit is contained in:
@@ -13,7 +13,7 @@ SERVED_MODEL="qwen3-30b-s3-real-full"
|
||||
MAX_MODEL_LEN="${MAX_MODEL_LEN:-40960}"
|
||||
ALLOW_SYNTHETIC_PROMPTS="${ALLOW_SYNTHETIC_PROMPTS:-false}"
|
||||
ALLOW_LONG_CONTEXT_SERVER="${ALLOW_LONG_CONTEXT_SERVER:-false}"
|
||||
FLASHINFER_WORKSPACE_BASE="/tmp/wjh/flashinfer-frontier-s3-real-v0-${RHO}-${CONFIG}-t${TRIAL}"
|
||||
FLASHINFER_WORKSPACE_BASE="${FLASHINFER_WORKSPACE_BASE:-/tmp/wjh/flashinfer-frontier-s3-real-v0-${CONFIG}}"
|
||||
SERVER_PID=""
|
||||
TELEMETRY_PID=""
|
||||
|
||||
@@ -45,6 +45,9 @@ if (( MAX_MODEL_LEN > 40960 )) && [[ "${ALLOW_LONG_CONTEXT_SERVER}" != "true" ]]
|
||||
echo "ERROR: MAX_MODEL_LEN>40960 requires ALLOW_LONG_CONTEXT_SERVER=true" >&2
|
||||
exit 1
|
||||
fi
|
||||
if (( MAX_MODEL_LEN > 40960 )); then
|
||||
export VLLM_CACHE_ROOT="${VLLM_CACHE_ROOT:-/tmp/wjh/vllm-cache-frontier-s3-real-longctx}"
|
||||
fi
|
||||
|
||||
TRACE_INPUT_ROOT="${TRACE_INPUT_ROOT:-${CONTROL_ROOT}/inputs/${INPUT_NAME}}"
|
||||
REQUESTS_FILE="${TRACE_INPUT_ROOT}/real_requests.jsonl"
|
||||
|
||||
Reference in New Issue
Block a user