Sketch to Adapt: Fine-Tunable Sketches for Efficient LLM Adaptation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Zhang, Tianyi, Su, Junda, Desai, Aditya, Wu, Oscar, Xu, Zhaozhuo, Shrivastava, Anshumali |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Scout Before You Attend: Sketch-and-Walk Sparse Attention for Efficient LLM Inference
par: Le, Hoang Anh Duy, et autres
Publié: (2026)
par: Le, Hoang Anh Duy, et autres
Publié: (2026)
KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization
par: Zhang, Tianyi, et autres
Publié: (2024)
par: Zhang, Tianyi, et autres
Publié: (2024)
NoMAD-Attention: Efficient LLM Inference on CPUs Through Multiply-add-free Attention
par: Zhang, Tianyi, et autres
Publié: (2024)
par: Zhang, Tianyi, et autres
Publié: (2024)
LeanQuant: Accurate and Scalable Large Language Model Quantization with Loss-error-aware Grid
par: Zhang, Tianyi, et autres
Publié: (2024)
par: Zhang, Tianyi, et autres
Publié: (2024)
To Compress or Not? Pushing the Frontier of Lossless GenAI Model Weights Compression with Exponent Concentration
par: Yang, Zeyu, et autres
Publié: (2025)
par: Yang, Zeyu, et autres
Publié: (2025)
LLM-Sketch: Enhancing Network Sketches with LLM
par: Li, Yuanpeng, et autres
Publié: (2025)
par: Li, Yuanpeng, et autres
Publié: (2025)
Sketching the Readout of Large Language Models for Scalable Data Attribution and Valuation
par: Ran, Yide, et autres
Publié: (2026)
par: Ran, Yide, et autres
Publié: (2026)
Empowering Distributed Training with Sparsity-driven Data Synchronization
par: Wang, Zhuang, et autres
Publié: (2023)
par: Wang, Zhuang, et autres
Publié: (2023)
Sketch-of-Thought: Efficient LLM Reasoning with Adaptive Cognitive-Inspired Sketching
par: Aytes, Simon A., et autres
Publié: (2025)
par: Aytes, Simon A., et autres
Publié: (2025)
CoVE: Compressed Vocabulary Expansion Makes Better LLM-based Recommender Systems
par: Zhang, Haochen, et autres
Publié: (2025)
par: Zhang, Haochen, et autres
Publié: (2025)
UltraSketchLLM: Saliency-Driven Sketching for Ultra-Low Bit LLM Compression
par: Zou, Sunan, et autres
Publié: (2025)
par: Zou, Sunan, et autres
Publié: (2025)
70% Size, 100% Accuracy: Lossless LLM Compression for Efficient GPU Inference via Dynamic-Length Float (DFloat11)
par: Zhang, Tianyi, et autres
Publié: (2025)
par: Zhang, Tianyi, et autres
Publié: (2025)
Beyond Johnson-Lindenstrauss: Uniform Bounds for Sketched Bilinear Forms
par: Deb, Rohan, et autres
Publié: (2025)
par: Deb, Rohan, et autres
Publié: (2025)
IDentity with Locality: An ideal hash for gene sequence search
par: Desai, Aditya, et autres
Publié: (2024)
par: Desai, Aditya, et autres
Publié: (2024)
Learning Scalable Structural Representations for Link Prediction with Bloom Signatures
par: Zhang, Tianyi, et autres
Publié: (2023)
par: Zhang, Tianyi, et autres
Publié: (2023)
Breaking the Frozen Subspace: Importance Sampling for Low-Rank Optimization in LLM Pretraining
par: Zhang, Haochen, et autres
Publié: (2025)
par: Zhang, Haochen, et autres
Publié: (2025)
U-Sketch: An Efficient Approach for Sketch to Image Diffusion Models
par: Mitsouras, Ilias, et autres
Publié: (2024)
par: Mitsouras, Ilias, et autres
Publié: (2024)
Instructing Robots by Sketching: Learning from Demonstration via Probabilistic Diagrammatic Teaching
par: Zhi, Weiming, et autres
Publié: (2023)
par: Zhi, Weiming, et autres
Publié: (2023)
PolySketchFormer: Fast Transformers via Sketching Polynomial Kernels
par: Kacham, Praneeth, et autres
Publié: (2023)
par: Kacham, Praneeth, et autres
Publié: (2023)
Revisiting Matrix Sketching in Linear Bandits: Achieving Sublinear Regret via Dyadic Block Sketching
par: Wen, Dongxie, et autres
Publié: (2024)
par: Wen, Dongxie, et autres
Publié: (2024)
SketchQL Demonstration: Zero-shot Video Moment Querying with Sketches
par: Wu, Renzhi, et autres
Publié: (2024)
par: Wu, Renzhi, et autres
Publié: (2024)
SOCKET: SOft Collision Kernel EsTimator for Sparse Attention
par: Joshi, Sahil, et autres
Publié: (2026)
par: Joshi, Sahil, et autres
Publié: (2026)
Sketch In, Sketch Out: Accelerating both Learning and Inference for Structured Prediction with Kernels
par: Ahmad, Tamim El, et autres
Publié: (2023)
par: Ahmad, Tamim El, et autres
Publié: (2023)
SketchFill: Sketch-Guided Code Generation for Imputing Derived Missing Values
par: Zhang, Yunfan, et autres
Publié: (2024)
par: Zhang, Yunfan, et autres
Publié: (2024)
Lego Sketch: A Scalable Memory-augmented Neural Network for Sketching Data Streams
par: Feng, Yuan, et autres
Publié: (2025)
par: Feng, Yuan, et autres
Publié: (2025)
SketchOGD: Memory-Efficient Continual Learning
par: Min, Youngjae, et autres
Publié: (2023)
par: Min, Youngjae, et autres
Publié: (2023)
On the (Generative) Linear Sketching Problem
par: Yuan, Xinyu, et autres
Publié: (2026)
par: Yuan, Xinyu, et autres
Publié: (2026)
Private Sketches for Linear Regression
par: Das, Shrutimoy, et autres
Publié: (2025)
par: Das, Shrutimoy, et autres
Publié: (2025)
Inference Time Context Sparsity: Illusion or Opportunity?
par: Joshi, Sahil, et autres
Publié: (2026)
par: Joshi, Sahil, et autres
Publié: (2026)
Efficient Sketches for Training Data Attribution and Studying the Loss Landscape
par: Schioppa, Andrea
Publié: (2024)
par: Schioppa, Andrea
Publié: (2024)
Communication-Efficient Federated Learning over Wireless Channels via Gradient Sketching
par: Gattani, Vineet Sunil, et autres
Publié: (2024)
par: Gattani, Vineet Sunil, et autres
Publié: (2024)
FLRQ: Faster LLM Quantization with Flexible Low-Rank Matrix Sketching
par: Gul, Hongyaoxing, et autres
Publié: (2026)
par: Gul, Hongyaoxing, et autres
Publié: (2026)
Sketch-and-Verify: Structured Inference-Time Scaling via Program Sketching
par: Jiang, Shan, et autres
Publié: (2026)
par: Jiang, Shan, et autres
Publié: (2026)
SketchDNN: Joint Continuous-Discrete Diffusion for CAD Sketch Generation
par: Chereddy, Sathvik, et autres
Publié: (2025)
par: Chereddy, Sathvik, et autres
Publié: (2025)
Private and Communication-Efficient Federated Learning based on Differentially Private Sketches
par: Zhang, Meifan, et autres
Publié: (2024)
par: Zhang, Meifan, et autres
Publié: (2024)
Optimized Learned Count-Min Sketch
par: Nishishita, Kyosuke, et autres
Publié: (2025)
par: Nishishita, Kyosuke, et autres
Publié: (2025)
Superintelligent Retrieval Agent: The Next Frontier of Information Retrieval
par: Yang, Zeyu, et autres
Publié: (2026)
par: Yang, Zeyu, et autres
Publié: (2026)
SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling
par: Ye, Fanjiang, et autres
Publié: (2025)
par: Ye, Fanjiang, et autres
Publié: (2025)
Adaptive-GraphSketch: Real-Time Edge Anomaly Detection via Multi-Layer Tensor Sketching and Temporal Decay
par: Ekle, Ocheme Anthony, et autres
Publié: (2025)
par: Ekle, Ocheme Anthony, et autres
Publié: (2025)
Sketched Sum-Product Networks for Joins
par: Tsan, Brian, et autres
Publié: (2025)
par: Tsan, Brian, et autres
Publié: (2025)
Documents similaires
-
Scout Before You Attend: Sketch-and-Walk Sparse Attention for Efficient LLM Inference
par: Le, Hoang Anh Duy, et autres
Publié: (2026) -
KV Cache is 1 Bit Per Channel: Efficient Large Language Model Inference with Coupled Quantization
par: Zhang, Tianyi, et autres
Publié: (2024) -
NoMAD-Attention: Efficient LLM Inference on CPUs Through Multiply-add-free Attention
par: Zhang, Tianyi, et autres
Publié: (2024) -
LeanQuant: Accurate and Scalable Large Language Model Quantization with Loss-error-aware Grid
par: Zhang, Tianyi, et autres
Publié: (2024) -
To Compress or Not? Pushing the Frontier of Lossless GenAI Model Weights Compression with Exponent Concentration
par: Yang, Zeyu, et autres
Publié: (2025)