| 04_knowledge_base/Tensor Core | 64 |
| 02_companies/NVDA | 53 |
| 04_knowledge_base/GPU | 34 |
| 04_knowledge_base/Hopper | 26 |
| 04_knowledge_base/CUDA | 23 |
| 04_knowledge_base/Blackwell | 18 |
| 04_knowledge_base/CUTLASS | 15 |
| 04_knowledge_base/PTX | 13 |
| 04_knowledge_base/TMA | 10 |
| 04_knowledge_base/tcgen05 | 10 |
| 04_knowledge_base/Sparsity | 8 |
| 04_knowledge_base/Quantization | 8 |
| 04_knowledge_base/Strong Scaling | 7 |
| 04_knowledge_base/NVIDIA SASS Assembly | 6 |
| 04_knowledge_base/HMMA | 6 |
| 04_knowledge_base/2SM MMA | 6 |
| 04_knowledge_base/Distributed shared memory | 5 |
| 04_knowledge_base/Pruning | 5 |
| 04_knowledge_base/Weak scaling | 5 |
| 04_knowledge_base/INT4 | 5 |
| 04_knowledge_base/FP8 | 4 |
| 04_knowledge_base/SIMT | 4 |
| 04_knowledge_base/GPU Shared Memory | 4 |
| 04_knowledge_base/Moore’s Law | 4 |
| 04_knowledge_base/NVFP4 | 4 |
| 02_companies/TSLA | 4 |
| 04_knowledge_base/Async copy | 4 |
| 04_knowledge_base/FP32 | 4 |
| 04_knowledge_base/NVIDIA V100 | 4 |
| 04_knowledge_base/HGMMA | 4 |
| 04_knowledge_base/NVIDIA Volta | 4 |
| 04_knowledge_base/BF16 | 4 |
| 04_knowledge_base/FP6 | 4 |
| 04_knowledge_base/Arithmetic intensity | 3 |
| 02_companies/Switch | 3 |
| 04_knowledge_base/2-of-4 Sparsity | 3 |
| 04_knowledge_base/FP4 | 3 |
| 04_knowledge_base/A100 | 3 |
| 04_knowledge_base/NVIDIA Turing | 3 |
| 04_knowledge_base/INT8 | 3 |
| 04_knowledge_base/Tensor Memory | 3 |
| 04_knowledge_base/Large language model | 2 |
| 04_knowledge_base/DRAM | 2 |
| 02_companies/Modal Labs | 2 |
| 04_knowledge_base/H100 | 2 |
| 02_companies/Together AI | 2 |
| 04_knowledge_base/SIMD | 2 |
| 04_knowledge_base/MXFP | 2 |
| 04_knowledge_base/Transistor | 2 |
| 04_knowledge_base/MXFP4 | 2 |
| 04_knowledge_base/DLSS | 2 |
| 04_knowledge_base/L2 cache | 2 |
| 04_knowledge_base/HBM | 1 |
| 04_knowledge_base/封裝 | 1 |
| 02_companies/DeepSeek | 1 |
| 04_knowledge_base/Llama | 1 |
| 02_companies/META | 1 |
| 04_knowledge_base/3D integration | 1 |
| 04_knowledge_base/KV cache | 1 |
| 04_knowledge_base/Dennard scaling | 1 |
| 04_knowledge_base/Prefix Caching | 1 |
| 04_knowledge_base/Blackwell Ultra | 1 |
| 02_companies/GOOG | 1 |
| 04_knowledge_base/SGLang | 1 |
| 04_knowledge_base/General Matrix Multiplication | 1 |
| 02_companies/COHR | 1 |
| 02_companies/GitHub | 1 |
| 04_knowledge_base/Graphics Processing Cluster | 1 |
| 04_knowledge_base/Decode | 1 |
| 04_knowledge_base/MXFP6 | 1 |
| 04_knowledge_base/Cost per Transistor | 1 |
| 04_knowledge_base/E4M3 | 1 |
| 04_knowledge_base/Cooperative Grid Array | 1 |
| 04_knowledge_base/GEMM kernel | 1 |
| 04_knowledge_base/WGMMA | 1 |
| 04_knowledge_base/MXFP8 | 1 |
| 04_knowledge_base/FP16 | 1 |
| 04_knowledge_base/CDNA4 | 1 |
| 04_knowledge_base/FP64 | 1 |
| 04_knowledge_base/Texture Processing Cluster | 1 |