@tri_dao
We're also releasing some fast kernels. The simplicity of Mamba-style models really makes it a lot easier to work with lower-level languages beyond Triton, such as TileLang and even CuTe-DSL! Controlling memory-movement really boosts speed; great for inference-heavy tasks! 7/10 https://t.co/BMnFmlORwO