#!/usr/bin/env bash # Long-context FlashAttention profile grid for the code-trace campaign. set -euo pipefail TP="${TP:?TP must be set to 1, 2, or 4}" case "${TP}" in 1|2|4) ;; *) echo "ERROR: invalid TP=${TP}" >&2; exit 1 ;; esac OUTPUT_ROOT="${OUTPUT_ROOT:?OUTPUT_ROOT must be set}" MAX_MODEL_LEN="${MAX_MODEL_LEN:-147456}" ALLOW_LONG_CONTEXT_PROFILE="${ALLOW_LONG_CONTEXT_PROFILE:-false}" VENV_ROOT="${VENV_ROOT:-/home/admin/cpfs/wjh/venvs/vllm-0.20.0-cu129-workload-regime-v2}" VLLM_SOURCE="${VLLM_SOURCE:-/home/admin/cpfs/wjh/agentic-kv/third_party/vllm_v20_build}" MODEL="${MODEL:-/home/admin/cpfs/wjh/models/Qwen/Qwen3-30B-A3B}" CAMPAIGN_ROOT="$(cd "$(dirname "${BASH_SOURCE[0]}")" && pwd)" PROFILE_SCRIPT="${CAMPAIGN_ROOT}/../frontier-qwen30-vllm020-profile-v1/profile_vllm020_flashattn.py" # Development window: # ISL p90=88,224, p99=125,803; sampled rho<=0.0032 max total=137,016. # Tail query distribution modulo 8192: # p10=495, p25=1477, p50=3594, p75=5917, p90=7246. # The full-chunk grid reaches 131,072 tokens of existing context; tail shapes # cover query-size variation at representative long contexts. BATCH_SPECS=( q8ks48k q8ks64k q8ks80k q8ks96k q8ks112k q8ks128k q8ks136k q512s128k q2ks66k q4ks100k q6ks134k q1ks8k q512s4k ) mkdir -p "${OUTPUT_ROOT}/logs" "${OUTPUT_ROOT}/provenance" "${OUTPUT_ROOT}/raw" exec > >(tee -a "${OUTPUT_ROOT}/logs/code-longctx-grid.log") 2>&1 IFS=',' read -r -a GPU_IDS <<< "${CUDA_VISIBLE_DEVICES:?one allocated fleet GPU is required}" if [[ "${#GPU_IDS[@]}" -ne 1 ]]; then echo "ERROR: expected exactly one GPU, got ${CUDA_VISIBLE_DEVICES}" >&2 exit 1 fi test -x "${VENV_ROOT}/bin/python" test -f "${VLLM_SOURCE}/benchmarks/attention_benchmarks/runner.py" test -f "${MODEL}/config.json" test -f "${PROFILE_SCRIPT}" if [[ "${ALLOW_LONG_CONTEXT_PROFILE}" != "true" ]]; then echo "ERROR: set ALLOW_LONG_CONTEXT_PROFILE=true after reviewing the model's 40960-token RoPE contract" >&2 exit 1 fi export VLLM_ALLOW_LONG_MAX_MODEL_LEN=1 echo "PROFILE_LAUNCH_ECHO host=$(hostname) gpu=${CUDA_VISIBLE_DEVICES} tp=${TP} max_model_len=${MAX_MODEL_LEN} specs=${BATCH_SPECS[*]}" date -u +"START_UTC=%Y-%m-%dT%H:%M:%SZ" nvidia-smi --query-gpu=index,name,driver_version,memory.used,utilization.gpu \ --format=csv,noheader git -C "${CAMPAIGN_ROOT}/../.." rev-parse HEAD \ > "${OUTPUT_ROOT}/provenance/aituner.commit" git -C "${VLLM_SOURCE}" rev-parse HEAD \ > "${OUTPUT_ROOT}/provenance/vllm-source.commit" sha256sum "${PROFILE_SCRIPT}" "${BASH_SOURCE[0]}" \ > "${OUTPUT_ROOT}/provenance/source.sha256" uv pip freeze --python "${VENV_ROOT}/bin/python" \ > "${OUTPUT_ROOT}/provenance/pip-freeze.txt" printf '%s\n' "${BATCH_SPECS[@]}" \ > "${OUTPUT_ROOT}/provenance/batch-specs.txt" printf '%s\n' "${MAX_MODEL_LEN}" \ > "${OUTPUT_ROOT}/provenance/max-model-len.txt" printf '%s\n' "${VLLM_ALLOW_LONG_MAX_MODEL_LEN}" \ > "${OUTPUT_ROOT}/provenance/vllm-allow-long-max-model-len.txt" timeout --signal=TERM --kill-after=30s 1800 \ "${VENV_ROOT}/bin/python" "${PROFILE_SCRIPT}" \ --vllm-source "${VLLM_SOURCE}" \ --model "${MODEL}" \ --output "${OUTPUT_ROOT}/raw/flashattn-code-longctx-tp${TP}.json" \ --tp "${TP}" \ --batch-specs "${BATCH_SPECS[@]}" \ --warmup-iters 5 \ --repeats 10 \ --max-model-len "${MAX_MODEL_LEN}" \ --profile-kv-update test -s "${OUTPUT_ROOT}/raw/flashattn-code-longctx-tp${TP}.json" sha256sum "${OUTPUT_ROOT}/raw/flashattn-code-longctx-tp${TP}.json" \ "${OUTPUT_ROOT}/provenance"/* > "${OUTPUT_ROOT}/artifacts.sha256" nvidia-smi --query-gpu=index,name,memory.used,utilization.gpu --format=csv,noheader date -u +"END_UTC=%Y-%m-%dT%H:%M:%SZ" echo "FLASHATTN_CODE_LONGCTX_COMPLETE tp=${TP} cases=${#BATCH_SPECS[@]}"