AI LLMの先読み生成、GPUの処理特性から候補トークン数を決める指針 LLMの投機的デコードで先読みするトークン数について、NVIDIAはGPU上の行列演算とAttentionの処理特性に基づく選定指針を示した。候… 2026.09.05