WUSH-KV: KV Cache Quantization with Data-Adaptive Transforms Paper • 2609.38121 • Published 12 days ago • 26
Disaggregated Quantization: Specializing LLM Prefill and Decode Paper • 2609.26333 • Published 19 days ago • 93
DASH: Faster Shampoo via Batched Block Preconditioning and Efficient Inverse-Root Solvers Paper • 2602.02016 • Published Feb 2 • 13
WUSH: Near-Optimal Adaptive Transforms for LLM Quantization Paper • 2512.00956 • Published Nov 30, 2025 • 23
Bridging the Gap Between Promise and Performance for Microscaling FP4 Quantization Paper • 2509.23202 • Published Sep 27, 2025 • 30
Efficient Data Selection at Scale via Influence Distillation Paper • 2505.19051 • Published May 25, 2025 • 4
SVD-Free Low-Rank Adaptive Gradient Optimization for Large Language Models Paper • 2505.17967 • Published May 23, 2025 • 17
Quartet: Native FP4 Training Can Be Optimal for Large Language Models Paper • 2505.14669 • Published May 20, 2025 • 79
Accurate Neural Network Pruning Requires Rethinking Sparse Optimization Paper • 2308.02060 • Published Aug 3, 2023 • 1
SparseProp: Efficient Sparse Backpropagation for Faster Training of Neural Networks Paper • 2302.04852 • Published Feb 9, 2023
Panza: A Personalized Text Writing Assistant via Data Playback and Local Fine-Tuning Paper • 2407.10994 • Published Jun 24, 2024 • 2
Panza: A Personalized Text Writing Assistant via Data Playback and Local Fine-Tuning Paper • 2407.10994 • Published Jun 24, 2024 • 2