Saagar Jha

I don’t know about you but if my AI compiler got 30 TFLOPs on a 4096x4096x4096 matrix multiply I might hesitate to say it “rivals Triton’s extensively optimized stack”

Saagar Jha

(replying to Saagar Jha)
Kimi K3 can build a coherent end-to-end compiler* – from DSL frontend and IR passes to PTX codegen† and runtime‡ – rather than isolated kernels; its from-scratch§ Tensor Core¶ path

*No you can’t see it
†We used MLIR
‡And NVRTC
§We gave it the Triton codebase
¶Not actually used