Reuse host-local caches for long-context replay
This commit is contained in:
@@ -13,7 +13,7 @@ SERVED_MODEL="qwen3-30b-s3-real-full"
|
|||||||
MAX_MODEL_LEN="${MAX_MODEL_LEN:-40960}"
|
MAX_MODEL_LEN="${MAX_MODEL_LEN:-40960}"
|
||||||
ALLOW_SYNTHETIC_PROMPTS="${ALLOW_SYNTHETIC_PROMPTS:-false}"
|
ALLOW_SYNTHETIC_PROMPTS="${ALLOW_SYNTHETIC_PROMPTS:-false}"
|
||||||
ALLOW_LONG_CONTEXT_SERVER="${ALLOW_LONG_CONTEXT_SERVER:-false}"
|
ALLOW_LONG_CONTEXT_SERVER="${ALLOW_LONG_CONTEXT_SERVER:-false}"
|
||||||
FLASHINFER_WORKSPACE_BASE="/tmp/wjh/flashinfer-frontier-s3-real-v0-${RHO}-${CONFIG}-t${TRIAL}"
|
FLASHINFER_WORKSPACE_BASE="${FLASHINFER_WORKSPACE_BASE:-/tmp/wjh/flashinfer-frontier-s3-real-v0-${CONFIG}}"
|
||||||
SERVER_PID=""
|
SERVER_PID=""
|
||||||
TELEMETRY_PID=""
|
TELEMETRY_PID=""
|
||||||
|
|
||||||
@@ -45,6 +45,9 @@ if (( MAX_MODEL_LEN > 40960 )) && [[ "${ALLOW_LONG_CONTEXT_SERVER}" != "true" ]]
|
|||||||
echo "ERROR: MAX_MODEL_LEN>40960 requires ALLOW_LONG_CONTEXT_SERVER=true" >&2
|
echo "ERROR: MAX_MODEL_LEN>40960 requires ALLOW_LONG_CONTEXT_SERVER=true" >&2
|
||||||
exit 1
|
exit 1
|
||||||
fi
|
fi
|
||||||
|
if (( MAX_MODEL_LEN > 40960 )); then
|
||||||
|
export VLLM_CACHE_ROOT="${VLLM_CACHE_ROOT:-/tmp/wjh/vllm-cache-frontier-s3-real-longctx}"
|
||||||
|
fi
|
||||||
|
|
||||||
TRACE_INPUT_ROOT="${TRACE_INPUT_ROOT:-${CONTROL_ROOT}/inputs/${INPUT_NAME}}"
|
TRACE_INPUT_ROOT="${TRACE_INPUT_ROOT:-${CONTROL_ROOT}/inputs/${INPUT_NAME}}"
|
||||||
REQUESTS_FILE="${TRACE_INPUT_ROOT}/real_requests.jsonl"
|
REQUESTS_FILE="${TRACE_INPUT_ROOT}/real_requests.jsonl"
|
||||||
|
|||||||
Reference in New Issue
Block a user