2023-12-18_inference-race-to-the-bottom-make
Canonical Target Counts
| Target | Occurrences |
|---|
| 04_knowledge_base/Mixtral | 9 |
| 04_knowledge_base/Large language model | 8 |
| 02_companies/OpenAI | 8 |
| 04_knowledge_base/H100 | 7 |
| 04_knowledge_base/Batch size | 7 |
| 02_companies/NVDA | 6 |
| 02_companies/AMD | 6 |
| 04_knowledge_base/Speculative Decoding | 6 |
| 04_knowledge_base/MI300X | 5 |
| 04_knowledge_base/Mixture of Experts | 5 |
| 02_companies/Together AI | 5 |
| 04_knowledge_base/A100 | 5 |
| 04_knowledge_base/H200 | 4 |
| 04_knowledge_base/GPU | 4 |
| 04_knowledge_base/GPT-3 | 4 |
| 02_companies/MSFT | 3 |
| 04_knowledge_base/vLLM | 3 |
| 04_knowledge_base/GPT-4 | 3 |
| 02_companies/GOOG | 2 |
| 04_knowledge_base/Microsoft Azure | 2 |
| 04_knowledge_base/FP8 | 2 |
| 04_knowledge_base/Quantization | 2 |
| 04_knowledge_base/Google Gemini | 2 |
| 02_companies/ByteDance | 2 |
| 04_knowledge_base/Tensor Parallelism | 1 |
| 04_knowledge_base/KV cache | 1 |
| 04_knowledge_base/Grok | 1 |
| 03_industries/SaaS產業 | 1 |
| 02_companies/META | 1 |
| 04_knowledge_base/PyTorch | 1 |
| 02_companies/Baidu | 1 |
| 04_knowledge_base/NVIDIA Collective Communications Library (NCCL) | 1 |
| 04_knowledge_base/Foundation models | 1 |
| 04_knowledge_base/Pre-training | 1 |
| 02_companies/Databricks | 1 |
| 04_knowledge_base/MI300 | 1 |
| 04_knowledge_base/Anthropic Claude | 1 |
| 02_companies/OpenRouter | 1 |
| 04_knowledge_base/All-Reduce | 1 |
| 04_knowledge_base/BF16 | 1 |
| 04_knowledge_base/Time to First Token | 1 |
| 04_knowledge_base/INT4 | 1 |
| 04_knowledge_base/Decode | 1 |
| 04_knowledge_base/Prefill | 1 |
| 04_knowledge_base/Inference engine | 1 |