IX2-0373

① SA Source

Context Before

image

Source: SemiAnalysis InferenceX

Evidence

Furthermore, we observe that inference optimization techniques such as speculative decoding, as explained earlier, can directly lead to cheaper inference

Context After

Take the following example, DeepSeek R1 FP4 on an 8k/1k workload. At an interactivity level of 150 tok/sec/user, the baseline GB300 Dynamo TRT cost per million tokens is approximately 0.11. This is a ~21x price decrease at this interactivity level simply by employing an inference optimization technique.

image

② Atomic Claim

此外,前文所述的 speculative decoding 等 inference optimization techniques,可直接降低 inference 成本。

  • Epistemic Mode: ASSERTED
  • Mapping Status: COMPLETE

③ Semantic Frame

{
  "attribute": "COST",
  "context_nodes": [],
  "entity": {
    "id": "04_knowledge_base/Speculative Decoding",
    "label": "speculative decoding"
  },
  "frame_type": "ATTRIBUTE",
  "qualifiers": {
    "condition_text": null,
    "numeric_mentions": [],
    "temporal_mentions": []
  },
  "value": {
    "numeric_mentions": [],
    "value_text": "此外,前文所述的 speculative decoding 等 inference optimization techniques,可直接降低 inference 成本。"
  }
}

④ Canonical Entity Mapping

RoleSurface LabelCanonical Target
entityspeculative decoding04_knowledge_base/Speculative Decoding

⑤ Human Review

請在 Properties 逐項確認:

  • 原文 → Atomic Claim 是否忠實
  • Atomic Claim → Semantic Frame 是否忠實
  • Canonical Entity mapping 是否正確
  • Epistemic mode 是否保留原文語氣
  • 最後選擇 review_action

Review state

Markdown 內文不是正式 approval。只有 Apply bridge 寫入的 Decision Ledger event 才是正式決策。