Files
aituner/runs/frontier-code-trace-v0/run_flashattn_code_longctx.sh

89 lines
3.6 KiB
Bash

#!/usr/bin/env bash
# Long-context FlashAttention profile grid for the code-trace campaign.
set -euo pipefail
TP="${TP:?TP must be set to 1, 2, or 4}"
case "${TP}" in
1|2|4) ;;
*) echo "ERROR: invalid TP=${TP}" >&2; exit 1 ;;
esac
OUTPUT_ROOT="${OUTPUT_ROOT:?OUTPUT_ROOT must be set}"
MAX_MODEL_LEN="${MAX_MODEL_LEN:-147456}"
ALLOW_LONG_CONTEXT_PROFILE="${ALLOW_LONG_CONTEXT_PROFILE:-false}"
VENV_ROOT="${VENV_ROOT:-/home/admin/cpfs/wjh/venvs/vllm-0.20.0-cu129-workload-regime-v2}"
VLLM_SOURCE="${VLLM_SOURCE:-/home/admin/cpfs/wjh/agentic-kv/third_party/vllm_v20_build}"
MODEL="${MODEL:-/home/admin/cpfs/wjh/models/Qwen/Qwen3-30B-A3B}"
CAMPAIGN_ROOT="$(cd "$(dirname "${BASH_SOURCE[0]}")" && pwd)"
PROFILE_SCRIPT="${CAMPAIGN_ROOT}/../frontier-qwen30-vllm020-profile-v1/profile_vllm020_flashattn.py"
# Development window:
# ISL p90=88,224, p99=125,803; sampled rho<=0.0032 max total=137,016.
# Tail query distribution modulo 8192:
# p10=495, p25=1477, p50=3594, p75=5917, p90=7246.
# The full-chunk grid reaches 131,072 tokens of existing context; tail shapes
# cover query-size variation at representative long contexts.
BATCH_SPECS=(
q8ks48k q8ks64k q8ks80k q8ks96k q8ks112k q8ks128k q8ks136k
q512s128k q2ks66k q4ks100k q6ks134k
q1ks8k q512s4k
)
mkdir -p "${OUTPUT_ROOT}/logs" "${OUTPUT_ROOT}/provenance" "${OUTPUT_ROOT}/raw"
exec > >(tee -a "${OUTPUT_ROOT}/logs/code-longctx-grid.log") 2>&1
IFS=',' read -r -a GPU_IDS <<< "${CUDA_VISIBLE_DEVICES:?one allocated fleet GPU is required}"
if [[ "${#GPU_IDS[@]}" -ne 1 ]]; then
echo "ERROR: expected exactly one GPU, got ${CUDA_VISIBLE_DEVICES}" >&2
exit 1
fi
test -x "${VENV_ROOT}/bin/python"
test -f "${VLLM_SOURCE}/benchmarks/attention_benchmarks/runner.py"
test -f "${MODEL}/config.json"
test -f "${PROFILE_SCRIPT}"
if [[ "${ALLOW_LONG_CONTEXT_PROFILE}" != "true" ]]; then
echo "ERROR: set ALLOW_LONG_CONTEXT_PROFILE=true after reviewing the model's 40960-token RoPE contract" >&2
exit 1
fi
export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1
echo "PROFILE_LAUNCH_ECHO host=$(hostname) gpu=${CUDA_VISIBLE_DEVICES} tp=${TP} max_model_len=${MAX_MODEL_LEN} specs=${BATCH_SPECS[*]}"
date -u +"START_UTC=%Y-%m-%dT%H:%M:%SZ"
nvidia-smi --query-gpu=index,name,driver_version,memory.used,utilization.gpu \
--format=csv,noheader
git -C "${CAMPAIGN_ROOT}/../.." rev-parse HEAD \
> "${OUTPUT_ROOT}/provenance/aituner.commit"
git -C "${VLLM_SOURCE}" rev-parse HEAD \
> "${OUTPUT_ROOT}/provenance/vllm-source.commit"
sha256sum "${PROFILE_SCRIPT}" "${BASH_SOURCE[0]}" \
> "${OUTPUT_ROOT}/provenance/source.sha256"
uv pip freeze --python "${VENV_ROOT}/bin/python" \
> "${OUTPUT_ROOT}/provenance/pip-freeze.txt"
printf '%s\n' "${BATCH_SPECS[@]}" \
> "${OUTPUT_ROOT}/provenance/batch-specs.txt"
printf '%s\n' "${MAX_MODEL_LEN}" \
> "${OUTPUT_ROOT}/provenance/max-model-len.txt"
printf '%s\n' "${VLLM_ALLOW_LONG_MAX_MODEL_LEN}" \
> "${OUTPUT_ROOT}/provenance/vllm-allow-long-max-model-len.txt"
timeout --signal=TERM --kill-after=30s 1800 \
"${VENV_ROOT}/bin/python" "${PROFILE_SCRIPT}" \
--vllm-source "${VLLM_SOURCE}" \
--model "${MODEL}" \
--output "${OUTPUT_ROOT}/raw/flashattn-code-longctx-tp${TP}.json" \
--tp "${TP}" \
--batch-specs "${BATCH_SPECS[@]}" \
--warmup-iters 5 \
--repeats 10 \
--max-model-len "${MAX_MODEL_LEN}" \
--profile-kv-update
test -s "${OUTPUT_ROOT}/raw/flashattn-code-longctx-tp${TP}.json"
sha256sum "${OUTPUT_ROOT}/raw/flashattn-code-longctx-tp${TP}.json" \
"${OUTPUT_ROOT}/provenance"/* > "${OUTPUT_ROOT}/artifacts.sha256"
nvidia-smi --query-gpu=index,name,memory.used,utilization.gpu --format=csv,noheader
date -u +"END_UTC=%Y-%m-%dT%H:%M:%SZ"
echo "FLASHATTN_CODE_LONGCTX_COMPLETE tp=${TP} cases=${#BATCH_SPECS[@]}"