Freeze code long context profile v6
This commit is contained in:
@@ -0,0 +1,8 @@
|
||||
759d33decc09d229d07818df8161ed41180cab575304f335ad4d5e7a917cbc93 runs/frontier-code-trace-v0/profiles/raw/tp4-r1-v2/raw/flashattn-code-longctx-tp4.json
|
||||
4e6d6002db037bdc71d40f76d6de979ef47960612c15dd985c04048c25bd1d41 runs/frontier-code-trace-v0/profiles/raw/tp4-r1-v2/provenance/aituner.commit
|
||||
420e4a613b1bcdb44b873eaa911f4a23129713ff9d486fc783b31a009a55cc85 runs/frontier-code-trace-v0/profiles/raw/tp4-r1-v2/provenance/batch-specs.txt
|
||||
5dd612a7806900e9d12afc27ccef196cc5518aea831aa4ed3b0a53bcfb5746cf runs/frontier-code-trace-v0/profiles/raw/tp4-r1-v2/provenance/max-model-len.txt
|
||||
484da176e7355ab5532d5129a8e78bea0ae84b3aa0a42c7f0bea9689667762ff runs/frontier-code-trace-v0/profiles/raw/tp4-r1-v2/provenance/pip-freeze.txt
|
||||
595b25965f76bf7ac25aa3b60126a437a083619303303aaf63346e993862253a runs/frontier-code-trace-v0/profiles/raw/tp4-r1-v2/provenance/source.sha256
|
||||
4355a46b19d348dc2f57c046f8ef63d4538ebb936000f3c9ee954a27460dd865 runs/frontier-code-trace-v0/profiles/raw/tp4-r1-v2/provenance/vllm-allow-long-max-model-len.txt
|
||||
11e8f5af440e3db4c01b519a7b0e30bbcecc3a57bfb53dd86d32e601beb95a32 runs/frontier-code-trace-v0/profiles/raw/tp4-r1-v2/provenance/vllm-source.commit
|
||||
@@ -0,0 +1 @@
|
||||
e251046c306a8e03214fe1b2f40caabb98f76b7b
|
||||
@@ -0,0 +1,13 @@
|
||||
q8ks48k
|
||||
q8ks64k
|
||||
q8ks80k
|
||||
q8ks96k
|
||||
q8ks112k
|
||||
q8ks128k
|
||||
q8ks136k
|
||||
q512s128k
|
||||
q2ks66k
|
||||
q4ks100k
|
||||
q6ks134k
|
||||
q1ks8k
|
||||
q512s4k
|
||||
@@ -0,0 +1 @@
|
||||
147456
|
||||
@@ -0,0 +1,179 @@
|
||||
aiohappyeyeballs==2.7.1
|
||||
aiohttp==3.14.1
|
||||
aiosignal==1.4.0
|
||||
annotated-doc==0.0.4
|
||||
annotated-types==0.7.0
|
||||
anthropic==0.117.0
|
||||
anyio==4.14.2
|
||||
apache-tvm-ffi==0.1.9
|
||||
astor==0.8.1
|
||||
attrs==26.1.0
|
||||
blake3==1.0.9
|
||||
cachetools==7.1.4
|
||||
cbor2==6.1.3
|
||||
certifi==2026.6.17
|
||||
cffi==2.1.0
|
||||
charset-normalizer==3.4.9
|
||||
click==8.4.2
|
||||
cloudpickle==3.1.2
|
||||
compressed-tensors==0.15.0.1
|
||||
cryptography==49.0.0
|
||||
cuda-bindings==12.9.7
|
||||
cuda-pathfinder==1.5.6
|
||||
cuda-python==12.9.7
|
||||
cuda-tile==1.5.0
|
||||
cuda-toolkit==12.9.1
|
||||
depyf==0.20.0
|
||||
detect-installer==0.1.0
|
||||
dill==0.4.1
|
||||
diskcache==5.6.3
|
||||
distro==1.9.0
|
||||
dnspython==2.8.0
|
||||
docstring-parser==0.18.0
|
||||
einops==0.8.2
|
||||
email-validator==2.3.0
|
||||
fastapi==0.139.2
|
||||
fastapi-cli==0.0.32
|
||||
fastapi-cloud-cli==0.22.2
|
||||
fastar==0.11.0
|
||||
fastsafetensors==0.3.3
|
||||
filelock==3.31.1
|
||||
flashinfer-cubin==0.6.8.post1
|
||||
flashinfer-python==0.6.8.post1
|
||||
frozenlist==1.8.0
|
||||
fsspec==2026.6.0
|
||||
gguf==0.19.0
|
||||
googleapis-common-protos==1.75.0
|
||||
grpcio==1.82.1
|
||||
h11==0.16.0
|
||||
hf-xet==1.5.2
|
||||
httpcore==1.0.9
|
||||
httptools==0.8.0
|
||||
httpx==0.28.1
|
||||
httpx-sse==0.4.3
|
||||
huggingface-hub==1.24.0
|
||||
idna==3.18
|
||||
ijson==3.5.1
|
||||
interegular==0.3.3
|
||||
jinja2==3.1.6
|
||||
jiter==0.16.0
|
||||
jmespath==1.1.0
|
||||
jsonschema==4.26.0
|
||||
jsonschema-specifications==2025.9.1
|
||||
lark==1.2.2
|
||||
llguidance==1.3.0
|
||||
llvmlite==0.47.0
|
||||
lm-format-enforcer==0.11.3
|
||||
loguru==0.7.3
|
||||
markdown-it-py==4.2.0
|
||||
markupsafe==3.0.3
|
||||
mcp==1.28.1
|
||||
mdurl==0.1.2
|
||||
mistral-common==1.11.6
|
||||
ml-dtypes==0.5.4
|
||||
model-hosting-container-standards==0.1.16
|
||||
mpmath==1.3.0
|
||||
msgspec==0.21.1
|
||||
multidict==6.7.1
|
||||
networkx==3.6.1
|
||||
ninja==1.13.0
|
||||
numba==0.65.0
|
||||
numpy==2.3.5
|
||||
nvidia-cublas-cu12==12.9.1.4
|
||||
nvidia-cuda-cupti-cu12==12.9.79
|
||||
nvidia-cuda-nvrtc-cu12==12.9.86
|
||||
nvidia-cuda-runtime-cu12==12.9.79
|
||||
nvidia-cudnn-cu12==9.17.1.4
|
||||
nvidia-cudnn-frontend==1.18.0
|
||||
nvidia-cufft-cu12==11.4.1.4
|
||||
nvidia-cufile-cu12==1.14.1.1
|
||||
nvidia-curand-cu12==10.3.10.19
|
||||
nvidia-cusolver-cu12==11.7.5.82
|
||||
nvidia-cusparse-cu12==12.5.10.65
|
||||
nvidia-cusparselt-cu12==0.7.1
|
||||
nvidia-cutlass-dsl==4.5.3
|
||||
nvidia-cutlass-dsl-libs-base==4.5.3
|
||||
nvidia-ml-py==13.610.43
|
||||
nvidia-nccl-cu12==2.28.9
|
||||
nvidia-nvjitlink-cu12==12.9.86
|
||||
nvidia-nvshmem-cu12==3.4.5
|
||||
nvidia-nvtx-cu12==12.9.79
|
||||
openai==2.46.0
|
||||
openai-harmony==0.0.8
|
||||
opencv-python-headless==5.0.0.93
|
||||
opentelemetry-api==1.44.0
|
||||
opentelemetry-exporter-otlp==1.44.0
|
||||
opentelemetry-exporter-otlp-proto-common==1.44.0
|
||||
opentelemetry-exporter-otlp-proto-grpc==1.44.0
|
||||
opentelemetry-exporter-otlp-proto-http==1.44.0
|
||||
opentelemetry-proto==1.44.0
|
||||
opentelemetry-sdk==1.44.0
|
||||
opentelemetry-semantic-conventions==0.65b0
|
||||
opentelemetry-semantic-conventions-ai==0.5.1
|
||||
outlines-core==0.2.14
|
||||
packaging==26.2
|
||||
partial-json-parser==0.2.1.1.post7
|
||||
pillow==12.3.0
|
||||
prometheus-client==0.25.0
|
||||
prometheus-fastapi-instrumentator==8.0.2
|
||||
propcache==0.5.2
|
||||
protobuf==7.35.1
|
||||
psutil==7.2.2
|
||||
py-cpuinfo==9.0.0
|
||||
pybase64==1.4.3
|
||||
pycountry==26.2.16
|
||||
pycparser==3.0
|
||||
pydantic==2.13.4
|
||||
pydantic-core==2.46.4
|
||||
pydantic-extra-types==2.11.1
|
||||
pydantic-settings==2.14.2
|
||||
pygments==2.20.0
|
||||
pyjwt==2.13.0
|
||||
python-dotenv==1.2.2
|
||||
python-json-logger==4.1.0
|
||||
python-multipart==0.0.32
|
||||
pyyaml==6.0.3
|
||||
pyzmq==27.1.0
|
||||
quack-kernels==0.5.0
|
||||
referencing==0.37.0
|
||||
regex==2026.7.19
|
||||
requests==2.34.2
|
||||
rich==15.0.0
|
||||
rich-toolkit==0.20.3
|
||||
rignore==0.8.0
|
||||
rpds-py==2026.6.3
|
||||
safetensors==0.8.0
|
||||
sentencepiece==0.2.2
|
||||
sentry-sdk==2.66.0
|
||||
setproctitle==1.3.7
|
||||
setuptools==80.10.2
|
||||
shellingham==1.5.4
|
||||
six==1.17.0
|
||||
sniffio==1.3.1
|
||||
sse-starlette==3.4.5
|
||||
starlette==1.3.1
|
||||
supervisor==4.3.0
|
||||
sympy==1.14.0
|
||||
tabulate==0.10.0
|
||||
tiktoken==0.13.0
|
||||
tilelang==0.1.9
|
||||
tokenizers==0.22.2
|
||||
torch==2.11.0+cu129
|
||||
torch-c-dlpack-ext==0.1.5
|
||||
torchaudio==2.11.0+cu129
|
||||
torchvision==0.26.0+cu129
|
||||
tqdm==4.69.0
|
||||
transformers==5.14.1
|
||||
triton==3.6.0
|
||||
typer==0.27.0
|
||||
typing-extensions==4.16.0
|
||||
typing-inspection==0.4.2
|
||||
urllib3==2.7.0
|
||||
uvicorn==0.51.0
|
||||
uvloop==0.22.1
|
||||
vllm @ https://github.com/vllm-project/vllm/releases/download/v0.20.0/vllm-0.20.0%2Bcu129-cp38-abi3-manylinux_2_31_x86_64.whl
|
||||
watchfiles==1.2.0
|
||||
websockets==16.1.1
|
||||
xgrammar==0.2.3
|
||||
yarl==1.24.5
|
||||
z3-solver==4.15.4.0
|
||||
@@ -0,0 +1,2 @@
|
||||
42381f4bd1b67710d4068eb8993240930326a804c6e5167b0b78df3420e47c74 /home/admin/cpfs/wjh/aituner/aituner-code-trace-fbaa909/runs/frontier-code-trace-v0/../frontier-qwen30-vllm020-profile-v1/profile_vllm020_flashattn.py
|
||||
8a7a72b3adb25db6a61a86f9b04d2d19ebbfe3f2d20480852ef2f45376ac3b85 runs/frontier-code-trace-v0/run_flashattn_code_longctx.sh
|
||||
@@ -0,0 +1 @@
|
||||
1
|
||||
@@ -0,0 +1 @@
|
||||
88d34c6409e9fb3c7b8ca0c04756f061d2099eb1
|
||||
@@ -0,0 +1,564 @@
|
||||
{
|
||||
"environment": {
|
||||
"attention_backend": "FLASH_ATTN",
|
||||
"block_size": 16,
|
||||
"dtype": "bfloat16",
|
||||
"gpu": "NVIDIA H20",
|
||||
"model": "/home/admin/cpfs/wjh/models/Qwen/Qwen3-30B-A3B",
|
||||
"profile_kv_update": true,
|
||||
"profile_method": "cuda_event",
|
||||
"torch_cuda": "12.9",
|
||||
"torch_version": "2.11.0+cu129",
|
||||
"vllm_source_commit": "88d34c6409e9fb3c7b8ca0c04756f061d2099eb1",
|
||||
"vllm_version": "0.20.0"
|
||||
},
|
||||
"rows": [
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q8ks48k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.039583999663591385,
|
||||
"mean_ms": 0.027286400087177753,
|
||||
"median_ms": 0.025200000032782555,
|
||||
"min_ms": 0.024191999807953835,
|
||||
"std_ms": 0.004620118437533604
|
||||
},
|
||||
"max_time": 0.011496224403381348,
|
||||
"mean_time": 0.011354345512390137,
|
||||
"memory_allocated_mb": 60.0849609375,
|
||||
"memory_reserved_mb": 62.0,
|
||||
"min_time": 0.01132140827178955,
|
||||
"std_time": 5.011776621543997e-05,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 721485.8831854897
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q8ks64k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.03232000023126602,
|
||||
"mean_ms": 0.026406400091946124,
|
||||
"median_ms": 0.02518399991095066,
|
||||
"min_ms": 0.024032000452280045,
|
||||
"std_ms": 0.002792696117638337
|
||||
},
|
||||
"max_time": 0.015639776229858397,
|
||||
"mean_time": 0.015451993656158448,
|
||||
"memory_allocated_mb": 68.0888671875,
|
||||
"memory_reserved_mb": 94.0,
|
||||
"min_time": 0.01542249584197998,
|
||||
"std_time": 6.304729308178388e-05,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 530158.1260185833
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q8ks80k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.03488000109791756,
|
||||
"mean_ms": 0.026147199980914592,
|
||||
"median_ms": 0.02459200005978346,
|
||||
"min_ms": 0.024224000051617622,
|
||||
"std_ms": 0.003303059079404486
|
||||
},
|
||||
"max_time": 0.01970569610595703,
|
||||
"mean_time": 0.01954985942840576,
|
||||
"memory_allocated_mb": 76.0927734375,
|
||||
"memory_reserved_mb": 134.0,
|
||||
"min_time": 0.019525152206420898,
|
||||
"std_time": 5.224891496533832e-05,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 419031.1459783236
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q8ks96k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.03046399913728237,
|
||||
"mean_ms": 0.0255103999748826,
|
||||
"median_ms": 0.024656000547111034,
|
||||
"min_ms": 0.024159999564290047,
|
||||
"std_ms": 0.00195717586616911
|
||||
},
|
||||
"max_time": 0.023927040100097656,
|
||||
"mean_time": 0.02367282257080078,
|
||||
"memory_allocated_mb": 84.0966796875,
|
||||
"memory_reserved_mb": 182.0,
|
||||
"min_time": 0.023630016326904296,
|
||||
"std_time": 8.715594728873713e-05,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 346050.83426360885
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q8ks112k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.03574400022625923,
|
||||
"mean_ms": 0.02678720001131296,
|
||||
"median_ms": 0.024720000103116035,
|
||||
"min_ms": 0.02380800060927868,
|
||||
"std_ms": 0.003678231234048846
|
||||
},
|
||||
"max_time": 0.02779840087890625,
|
||||
"mean_time": 0.027747158622741696,
|
||||
"memory_allocated_mb": 92.1005859375,
|
||||
"memory_reserved_mb": 238.0,
|
||||
"min_time": 0.027736671447753908,
|
||||
"std_time": 1.8952179343788658e-05,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 295237.4371509809
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q8ks128k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.042080000042915344,
|
||||
"mean_ms": 0.02844479978084564,
|
||||
"median_ms": 0.02527999971061945,
|
||||
"min_ms": 0.024224000051617622,
|
||||
"std_ms": 0.006562862750709003
|
||||
},
|
||||
"max_time": 0.03208835220336914,
|
||||
"mean_time": 0.03186994876861572,
|
||||
"memory_allocated_mb": 100.1044921875,
|
||||
"memory_reserved_mb": 302.0,
|
||||
"min_time": 0.03183427238464356,
|
||||
"std_time": 7.444245241186317e-05,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 257044.65543625728
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q8ks136k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.03139200061559677,
|
||||
"mean_ms": 0.026396799832582474,
|
||||
"median_ms": 0.025071999989449978,
|
||||
"min_ms": 0.02377600036561489,
|
||||
"std_ms": 0.0025962810796740263
|
||||
},
|
||||
"max_time": 0.033969856262207034,
|
||||
"mean_time": 0.033897081375122075,
|
||||
"memory_allocated_mb": 104.1064453125,
|
||||
"memory_reserved_mb": 370.0,
|
||||
"min_time": 0.03388313674926758,
|
||||
"std_time": 2.518493598134421e-05,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 241672.72424853416
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q512s128k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.022624000906944275,
|
||||
"mean_ms": 0.017174400109797715,
|
||||
"median_ms": 0.015536000020802021,
|
||||
"min_ms": 0.014944000169634819,
|
||||
"std_ms": 0.0028331860349340154
|
||||
},
|
||||
"max_time": 0.003192960023880005,
|
||||
"mean_time": 0.003182867193222046,
|
||||
"memory_allocated_mb": 66.2958984375,
|
||||
"memory_reserved_mb": 372.0,
|
||||
"min_time": 0.003179744005203247,
|
||||
"std_time": 3.5239767128429387e-06,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 160861.25148115202
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q2ks66k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.02985600009560585,
|
||||
"mean_ms": 0.017318400088697672,
|
||||
"median_ms": 0.015568000264465809,
|
||||
"min_ms": 0.014655999839305878,
|
||||
"std_ms": 0.004479309643844885
|
||||
},
|
||||
"max_time": 0.004826848030090332,
|
||||
"mean_time": 0.004817302370071412,
|
||||
"memory_allocated_mb": 42.04248046875,
|
||||
"memory_reserved_mb": 372.0,
|
||||
"min_time": 0.004811935901641846,
|
||||
"std_time": 5.94674080057053e-06,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 425134.20222979283
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q4ks100k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.03916800022125244,
|
||||
"mean_ms": 0.021356799826025962,
|
||||
"median_ms": 0.01935999933630228,
|
||||
"min_ms": 0.017184000462293625,
|
||||
"std_ms": 0.0062801287963799276
|
||||
},
|
||||
"max_time": 0.014635007858276367,
|
||||
"mean_time": 0.014412275123596191,
|
||||
"memory_allocated_mb": 68.06640625,
|
||||
"memory_reserved_mb": 372.0,
|
||||
"min_time": 0.014374591827392579,
|
||||
"std_time": 7.569270440104603e-05,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 284202.17938345566
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q6ks134k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.033215999603271484,
|
||||
"mean_ms": 0.023340800032019614,
|
||||
"median_ms": 0.02092800009995699,
|
||||
"min_ms": 0.020479999482631683,
|
||||
"std_ms": 0.004304974035052475
|
||||
},
|
||||
"max_time": 0.02418492889404297,
|
||||
"mean_time": 0.02411243553161621,
|
||||
"memory_allocated_mb": 96.09033203125,
|
||||
"memory_reserved_mb": 372.0,
|
||||
"min_time": 0.024088096618652344,
|
||||
"std_time": 2.797845886790172e-05,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 254806.28001862322
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q1ks8k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.04992000013589859,
|
||||
"mean_ms": 0.019958400167524815,
|
||||
"median_ms": 0.015552000608295202,
|
||||
"min_ms": 0.014688000082969666,
|
||||
"std_ms": 0.010290953685254347
|
||||
},
|
||||
"max_time": 0.00036675199866294863,
|
||||
"mean_time": 0.0003469599992036819,
|
||||
"memory_allocated_mb": 8.5205078125,
|
||||
"memory_reserved_mb": 372.0,
|
||||
"min_time": 0.0003364480137825012,
|
||||
"std_time": 7.875187259592915e-06,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 2951348.865431786
|
||||
},
|
||||
{
|
||||
"attention_core_excludes_kv_cache_update": true,
|
||||
"config": {
|
||||
"backend": "FLASH_ATTN",
|
||||
"batch_spec": "q512s4k",
|
||||
"block_size": 16,
|
||||
"device": "cuda:0",
|
||||
"dtype": "torch.bfloat16",
|
||||
"head_dim": 128,
|
||||
"kv_cache_dtype": "auto",
|
||||
"kv_lora_rank": null,
|
||||
"num_kv_heads": 1,
|
||||
"num_kv_splits": null,
|
||||
"num_layers": 1,
|
||||
"num_q_heads": 8,
|
||||
"prefill_backend": null,
|
||||
"profile_memory": true,
|
||||
"qk_nope_head_dim": null,
|
||||
"qk_rope_head_dim": null,
|
||||
"reorder_batch_threshold": null,
|
||||
"repeats": 10,
|
||||
"use_cuda_graphs": false,
|
||||
"v_head_dim": null,
|
||||
"warmup_iters": 5
|
||||
},
|
||||
"error": null,
|
||||
"kv_cache_update_time": {
|
||||
"max_ms": 0.022336000576615334,
|
||||
"mean_ms": 0.016252800077199935,
|
||||
"median_ms": 0.014895999804139137,
|
||||
"min_ms": 0.014271999709308147,
|
||||
"std_ms": 0.0028271219653727385
|
||||
},
|
||||
"max_time": 0.00016867199540138245,
|
||||
"mean_time": 0.00015103680044412614,
|
||||
"memory_allocated_mb": 4.265625,
|
||||
"memory_reserved_mb": 372.0,
|
||||
"min_time": 0.00014329600334167482,
|
||||
"std_time": 7.872199103975806e-06,
|
||||
"tensor_parallel_size": 4,
|
||||
"throughput_tokens_per_sec": 3389902.3184710997
|
||||
}
|
||||
],
|
||||
"schema_version": "qwen30_vllm020_flashattn_raw.v1"
|
||||
}
|
||||
Reference in New Issue
Block a user