Files
aituner/runs/frontier-fidelity-envelope-v1/jobs_qwen235_iteration_state_tp4_r2.toml

30 lines
1.1 KiB
TOML

version = 1
[[jobs]]
name = "qwen235-fixed-pd-iteration-state-tp4-20260719-r2"
gpus = 4
gpu_model = "H20"
hosts = ["dash0"]
command = "cd /home/admin/cpfs/wjh/aituner/aituner-q235-collective-20260719/runs/frontier-fidelity-envelope-v1 && timeout --signal=TERM --kill-after=60s 7800 bash run_qwen30_exact_trace_real_anchor.sh"
[jobs.env]
XDG_CACHE_HOME = "/tmp/wjh/.cache"
VLLM_CACHE_ROOT = "/tmp/wjh/.cache/vllm"
TP = "4"
MNS = "64"
TRACE_LABEL = "fixed-pd/tp4-iteration-state-r2"
SERVER_PORT = "9512"
OUTPUT_ROOT = "/home/admin/cpfs/wjh/aituner/qwen235-fixed-pd-state-diagnosis-20260719-r1/iteration-real/tp4_ep1_mns64"
REQUESTS_FILE = "/home/admin/cpfs/wjh/aituner/qwen235-v020-fourcase-20260719-r1/traces/fixed-pd/tp4/private/real_requests.jsonl"
VENV_ROOT = "/tmp/wjh/venvs/vllm-0.20.0-cu129-profiler-v1"
MODEL_ROOT = "/home/admin/cpfs/wjh/models/Qwen/Qwen3-235B-A22B-FP8"
SERVED_MODEL = "qwen3-235b-v020-eval"
PREFIX_CACHING = "false"
ENABLE_EXPERT_PARALLEL = "false"
MODEL_QUANTIZATION = "fp8"
DISABLE_CUSTOM_ALL_REDUCE = "true"
GPU_MEMORY_UTILIZATION = "0.80"
SERVER_READY_ATTEMPTS = "600"
CLIENT_TIMEOUT_SECONDS = "6000"
ENABLE_LOGGING_ITERATION_DETAILS = "true"