kernelsJun 18, 2026 · 20 min
Accelerating GPU vector retrieval scoring via FP16 accumulation
Evaluating PyTorch FP16 Tensor Core accumulation flags across dense retrieval scoring workloads. Achieves 1.59× speedups in matrix scoring operations and 1.25× end-to-end pipeline latency improvements while preserving Recall@10 = 0.987 ranking accuracy.
retrievalcuBLASsearch
1.59×faster retrieval scoringfp32-acc ▸ fp16-acc