https://github.com/llvm/llvm-project/blob/60cd3eb880fe48d192a58c64a1e38e875fc65377/mlir/test/Integration/GPU/CUDA/sm90/gemm_pred_f32_f16_f16_128x128x128.mlir
有TMA的看起来还挺好写,没TMA的手动mma想想就好烦
有TMA的看起来还挺好写,没TMA的手动mma想想就好烦
消息来源频道
@zyf_at_rochester
后向兼容什么的,才没人在意呢!