version = 1 [[jobs]] name = "qwen235-fixed-pd-iteration-state-tp4-20260719-r1" gpus = 4 gpu_model = "H20" hosts = ["dash0"] command = "cd /home/admin/cpfs/wjh/aituner/aituner-q235-collective-20260719/runs/frontier-fidelity-envelope-v1 && timeout --signal=TERM --kill-after=60s 7800 bash run_qwen30_exact_trace_real_anchor.sh" [jobs.env] XDG_CACHE_HOME = "/tmp/wjh/.cache" VLLM_CACHE_ROOT = "/tmp/wjh/.cache/vllm" TP = "4" MNS = "64" TRACE_LABEL = "fixed-pd/tp4-iteration-state" SERVER_PORT = "9510" OUTPUT_ROOT = "/home/admin/cpfs/wjh/aituner/qwen235-fixed-pd-state-diagnosis-20260719-r1/iteration-real/tp4_ep1_mns64" REQUESTS_FILE = "/home/admin/cpfs/wjh/aituner/qwen235-v020-fourcase-20260719-r1/traces/fixed-pd/tp4/private/real_requests.jsonl" VENV_ROOT = "/tmp/wjh/venvs/vllm-0.20.0-cu129-profiler-v1" MODEL_ROOT = "/home/admin/cpfs/wjh/models/Qwen/Qwen3-235B-A22B-FP8" SERVED_MODEL = "qwen3-235b-v020-eval" PREFIX_CACHING = "false" ENABLE_EXPERT_PARALLEL = "false" MODEL_QUANTIZATION = "fp8" DISABLE_CUSTOM_ALL_REDUCE = "true" GPU_MEMORY_UTILIZATION = "0.80" SERVER_READY_ATTEMPTS = "600" CLIENT_TIMEOUT_SECONDS = "6000" ENABLE_LOGGING_ITERATION_DETAILS = "true" [[jobs]] name = "qwen235-fixed-pd-iteration-state-tp8-20260719-r1" gpus = 8 gpu_model = "H20" hosts = ["dash0"] command = "cd /home/admin/cpfs/wjh/aituner/aituner-q235-collective-20260719/runs/frontier-fidelity-envelope-v1 && timeout --signal=TERM --kill-after=60s 7800 bash run_qwen30_exact_trace_real_anchor.sh" [jobs.env] XDG_CACHE_HOME = "/tmp/wjh/.cache" VLLM_CACHE_ROOT = "/tmp/wjh/.cache/vllm" TP = "8" MNS = "64" TRACE_LABEL = "fixed-pd/tp8-iteration-state" SERVER_PORT = "9511" OUTPUT_ROOT = "/home/admin/cpfs/wjh/aituner/qwen235-fixed-pd-state-diagnosis-20260719-r1/iteration-real/tp8_ep8_mns64" REQUESTS_FILE = "/home/admin/cpfs/wjh/aituner/qwen235-v020-fourcase-20260719-r1/traces/fixed-pd/tp8/private/real_requests.jsonl" VENV_ROOT = "/tmp/wjh/venvs/vllm-0.20.0-cu129-profiler-v1" MODEL_ROOT = "/home/admin/cpfs/wjh/models/Qwen/Qwen3-235B-A22B-FP8" SERVED_MODEL = "qwen3-235b-v020-eval" PREFIX_CACHING = "false" ENABLE_EXPERT_PARALLEL = "true" MODEL_QUANTIZATION = "fp8" DISABLE_CUSTOM_ALL_REDUCE = "true" GPU_MEMORY_UTILIZATION = "0.80" SERVER_READY_ATTEMPTS = "600" CLIENT_TIMEOUT_SECONDS = "6000" ENABLE_LOGGING_ITERATION_DETAILS = "true"