TwELL – Sakana AI og NVIDIA gir LLM-er 20,5% raskere inferens med CUDA-kjerner
Sakana AI og NVIDIA har utviklet TwELL – et CUDA-optimert sparse dataformat som gir opptil 20,5% raskere inferens og 21,9% raskere trening av LLM-er. Teknikken bruker L1-regularisering og ReLU for å skape 99,5% sparsity i feedforward-lagene, og egne CUDA-kjerner for å omsette det til reell GPU-gjennomstrøming.