kernelsJul 1, 2026 · 17 min
Accelerating dense physics solves via FP16 Tensor Core accumulation
Dense matrix inversions, Gaussian process regression, and PDE Green's function applications reduce to large matrix multiplications that execute at half-rate on consumer Ampere GPUs. Enabling FP16 accumulation recovers 1.84–1.91× speedups at ~1e-3 relative error against FP64 reference solves.
physicstensor coreslinear algebra
1.91×faster dense solvesfp32-acc ▸ fp16-acc