Add code long-context attention profiling grid
This commit is contained in:
80
runs/frontier-code-trace-v0/run_flashattn_code_longctx.sh
Normal file
80
runs/frontier-code-trace-v0/run_flashattn_code_longctx.sh
Normal file
@@ -0,0 +1,80 @@
|
||||
#!/usr/bin/env bash
|
||||
# Long-context FlashAttention profile grid for the code-trace campaign.
|
||||
|
||||
set -euo pipefail
|
||||
|
||||
TP="${TP:?TP must be set to 1, 2, or 4}"
|
||||
case "${TP}" in
|
||||
1|2|4) ;;
|
||||
*) echo "ERROR: invalid TP=${TP}" >&2; exit 1 ;;
|
||||
esac
|
||||
|
||||
OUTPUT_ROOT="${OUTPUT_ROOT:?OUTPUT_ROOT must be set}"
|
||||
MAX_MODEL_LEN="${MAX_MODEL_LEN:-147456}"
|
||||
VENV_ROOT="${VENV_ROOT:-/home/admin/cpfs/wjh/venvs/vllm-0.20.0-cu129-workload-regime-v2}"
|
||||
VLLM_SOURCE="${VLLM_SOURCE:-/home/admin/cpfs/wjh/agentic-kv/third_party/vllm_v20_build}"
|
||||
MODEL="${MODEL:-/home/admin/cpfs/wjh/models/Qwen/Qwen3-30B-A3B}"
|
||||
CAMPAIGN_ROOT="$(cd "$(dirname "${BASH_SOURCE[0]}")" && pwd)"
|
||||
PROFILE_SCRIPT="${CAMPAIGN_ROOT}/../frontier-qwen30-vllm020-profile-v1/profile_vllm020_flashattn.py"
|
||||
|
||||
# Development window:
|
||||
# ISL p90=88,224, p99=125,803; sampled rho<=0.0032 max total=137,016.
|
||||
# Tail query distribution modulo 8192:
|
||||
# p10=495, p25=1477, p50=3594, p75=5917, p90=7246.
|
||||
# The full-chunk grid reaches 131,072 tokens of existing context; tail shapes
|
||||
# cover query-size variation at representative long contexts.
|
||||
BATCH_SPECS=(
|
||||
q8ks48k q8ks64k q8ks80k q8ks96k q8ks112k q8ks128k q8ks136k
|
||||
q512s128k q2ks66k q4ks100k q6ks134k
|
||||
q1ks8k q512s4k
|
||||
)
|
||||
|
||||
mkdir -p "${OUTPUT_ROOT}/logs" "${OUTPUT_ROOT}/provenance" "${OUTPUT_ROOT}/raw"
|
||||
exec > >(tee -a "${OUTPUT_ROOT}/logs/code-longctx-grid.log") 2>&1
|
||||
|
||||
IFS=',' read -r -a GPU_IDS <<< "${CUDA_VISIBLE_DEVICES:?one allocated fleet GPU is required}"
|
||||
if [[ "${#GPU_IDS[@]}" -ne 1 ]]; then
|
||||
echo "ERROR: expected exactly one GPU, got ${CUDA_VISIBLE_DEVICES}" >&2
|
||||
exit 1
|
||||
fi
|
||||
|
||||
test -x "${VENV_ROOT}/bin/python"
|
||||
test -f "${VLLM_SOURCE}/benchmarks/attention_benchmarks/runner.py"
|
||||
test -f "${MODEL}/config.json"
|
||||
test -f "${PROFILE_SCRIPT}"
|
||||
|
||||
echo "PROFILE_LAUNCH_ECHO host=$(hostname) gpu=${CUDA_VISIBLE_DEVICES} tp=${TP} max_model_len=${MAX_MODEL_LEN} specs=${BATCH_SPECS[*]}"
|
||||
date -u +"START_UTC=%Y-%m-%dT%H:%M:%SZ"
|
||||
nvidia-smi --query-gpu=index,name,driver_version,memory.used,utilization.gpu \
|
||||
--format=csv,noheader
|
||||
git -C "${CAMPAIGN_ROOT}/../.." rev-parse HEAD \
|
||||
> "${OUTPUT_ROOT}/provenance/aituner.commit"
|
||||
git -C "${VLLM_SOURCE}" rev-parse HEAD \
|
||||
> "${OUTPUT_ROOT}/provenance/vllm-source.commit"
|
||||
sha256sum "${PROFILE_SCRIPT}" "${BASH_SOURCE[0]}" \
|
||||
> "${OUTPUT_ROOT}/provenance/source.sha256"
|
||||
uv pip freeze --python "${VENV_ROOT}/bin/python" \
|
||||
> "${OUTPUT_ROOT}/provenance/pip-freeze.txt"
|
||||
printf '%s\n' "${BATCH_SPECS[@]}" \
|
||||
> "${OUTPUT_ROOT}/provenance/batch-specs.txt"
|
||||
printf '%s\n' "${MAX_MODEL_LEN}" \
|
||||
> "${OUTPUT_ROOT}/provenance/max-model-len.txt"
|
||||
|
||||
timeout --signal=TERM --kill-after=30s 1800 \
|
||||
"${VENV_ROOT}/bin/python" "${PROFILE_SCRIPT}" \
|
||||
--vllm-source "${VLLM_SOURCE}" \
|
||||
--model "${MODEL}" \
|
||||
--output "${OUTPUT_ROOT}/raw/flashattn-code-longctx-tp${TP}.json" \
|
||||
--tp "${TP}" \
|
||||
--batch-specs "${BATCH_SPECS[@]}" \
|
||||
--warmup-iters 5 \
|
||||
--repeats 10 \
|
||||
--max-model-len "${MAX_MODEL_LEN}" \
|
||||
--profile-kv-update
|
||||
|
||||
test -s "${OUTPUT_ROOT}/raw/flashattn-code-longctx-tp${TP}.json"
|
||||
sha256sum "${OUTPUT_ROOT}/raw/flashattn-code-longctx-tp${TP}.json" \
|
||||
"${OUTPUT_ROOT}/provenance"/* > "${OUTPUT_ROOT}/artifacts.sha256"
|
||||
nvidia-smi --query-gpu=index,name,memory.used,utilization.gpu --format=csv,noheader
|
||||
date -u +"END_UTC=%Y-%m-%dT%H:%M:%SZ"
|
||||
echo "FLASHATTN_CODE_LONGCTX_COMPLETE tp=${TP} cases=${#BATCH_SPECS[@]}"
|
||||
Reference in New Issue
Block a user