AI
生体分子AIモデル30超を平均約4倍に高速化、Claudeが4週間弱で推論を最適化
生体分子の構造予測やタンパク質設計に使う30超のAIモデルで、推論処理が平均約4倍に高速化した。Claudeは高負荷なGPU演算とモデル固有の無…
TOPIC
生体分子の構造予測やタンパク質設計に使う30超のAIモデルで、推論処理が平均約4倍に高速化した。Claudeは高負荷なGPU演算とモデル固有の無…
GPUカーネルをPython系の実装からRustへ移すAIエージェント用スキルにより、TileGymの公開演算子24種が移植された。NVIDIA…
ROCmのマルチアーキテクチャ配布は、GPU固有カーネルを共通のホストコードから分離する。利用者は共通インデックスから、必要なGPU向けコードを…
線形代数とFFTをアプリケーション固有の処理と同じCUDAカーネル内で実行し、中間データを共有メモリやレジスタから次の演算へ渡せる。グローバルメ…
履歴を固定サイズへ圧縮し、必要な領域だけをブロック単位で参照する長文AIモデルが登場した。100万トークン条件の公開ベンチマークでは、Atten…
ローカルAIエージェント向けの推論基盤llama.cppが、先読み検証とGPU上の実行順序の改善で高速化した。NVIDIAによると、Qwenの2…