2026-06-09_deepseekv4-16t-day-0-to-day-43-performance

Canonical Target Counts

TargetOccurrences
02_companies/DeepSeek53
04_knowledge_base/InferenceX33
04_knowledge_base/vLLM27
02_companies/Huawei24
04_knowledge_base/SGLang23
02_companies/AMD22
04_knowledge_base/Decode18
04_knowledge_base/CUDA16
04_knowledge_base/Mixture of Experts16
02_companies/NVDA14
04_knowledge_base/Huawei CANN14
04_knowledge_base/FP413
04_knowledge_base/KV cache12
04_knowledge_base/FP811
04_knowledge_base/Huawei Ascend11
04_knowledge_base/AMD ATOM inference engine9
04_knowledge_base/NVIDIA B2009
04_knowledge_base/GB3009
04_knowledge_base/AMD AITER8
04_knowledge_base/Prefill8
04_knowledge_base/GPU7
04_knowledge_base/MI355X7
04_knowledge_base/H2006
04_knowledge_base/ROCm6
04_knowledge_base/Ascend AI CPU6
04_knowledge_base/Triton5
04_knowledge_base/NVIDIA B3005
04_knowledge_base/Sparse Attention4
04_knowledge_base/Expert Parallelism4
02_companies/GitHub4
04_knowledge_base/Ascend 9504
04_knowledge_base/MXFP44
04_knowledge_base/Batch size4
04_knowledge_base/TPU3
04_knowledge_base/Flash memory3
02_companies/CRWV3
04_knowledge_base/Large language model3
04_knowledge_base/NVLink3
04_knowledge_base/Ascend 950DT3
04_knowledge_base/GB200 NVL723
04_knowledge_base/HBM2
02_companies/Inferact2
04_knowledge_base/InfiniBand2
04_knowledge_base/Multi-Query Attention2
04_knowledge_base/PyTorch2
04_knowledge_base/Pipeline parallelism2
04_knowledge_base/Hopper2
04_knowledge_base/SIMT2
02_companies/Switch2
04_knowledge_base/Trainium2
04_knowledge_base/GB300 NVL722
04_knowledge_base/SIMD2
04_knowledge_base/MXFP82
04_knowledge_base/TF322
04_knowledge_base/TensorRT-LLM2
04_knowledge_base/CPU2
04_knowledge_base/Inference engine2
04_knowledge_base/BF162
02_companies/META1
02_companies/ORCL1
02_companies/MSFT1
04_knowledge_base/Blackwell1
02_companies/OpenAI1
04_knowledge_base/Quantization1
04_knowledge_base/KV Cache Offloading1
04_knowledge_base/Merged Compute-Communication (MC²)1
04_knowledge_base/AMD HIP1
04_knowledge_base/AI Vector (AIV)1
04_knowledge_base/TMA1
04_knowledge_base/Feed-forward Network1
04_knowledge_base/Tokenomics Model1
04_knowledge_base/Fault tolerance1
02_companies/Together AI1
04_knowledge_base/DeepGEMM1
04_knowledge_base/Multi-head Latent Attention1
02_companies/WEKA1
04_knowledge_base/Heavily Compressed Attention1
04_knowledge_base/NVFP41
04_knowledge_base/Compressed Sparse Attention1
04_knowledge_base/CCU Communication Engine1
04_knowledge_base/Tensor Core1
04_knowledge_base/NVL backplane1
04_knowledge_base/NVIDIA Inference Xfer Library (NIXL)1
04_knowledge_base/Prefix Caching1
04_knowledge_base/GB2001
04_knowledge_base/Checkpointing1
04_knowledge_base/Eager mode1
04_knowledge_base/Disaggregated prefill1
04_knowledge_base/gfx9501
04_knowledge_base/Disaggregated inference1
04_knowledge_base/DeepEP1