Agreement-Based Cascading for Efficient Inference
Fuente:
arXiv
Saved in:
| Main Authors: | Kolawole, Steven, Dennis, Don, Talwalkar, Ameet, Smith, Virginia |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes
by: Kolawole, Steven, et al.
Published: (2024)
by: Kolawole, Steven, et al.
Published: (2024)
UPS: Efficiently Building Foundation Models for PDE Solving via Cross-Modal Adaptation
by: Shen, Junhong, et al.
Published: (2024)
by: Shen, Junhong, et al.
Published: (2024)
Semantic Agreement Enables Efficient Open-Ended LLM Cascades
by: Soiffer, Duncan, et al.
Published: (2025)
by: Soiffer, Duncan, et al.
Published: (2025)
The Impact of Element Ordering on LM Agent Performance
by: Chi, Wayne, et al.
Published: (2024)
by: Chi, Wayne, et al.
Published: (2024)
PARALLELPROMPT: Extracting Parallelism from Large Language Model Queries
by: Kolawole, Steven, et al.
Published: (2025)
by: Kolawole, Steven, et al.
Published: (2025)
Provably tuning the ElasticNet across instances
by: Balcan, Maria-Florina, et al.
Published: (2022)
by: Balcan, Maria-Florina, et al.
Published: (2022)
Spend Less, Fit Better: Budget-Efficient Scaling Law Fitting via Active Experiment Selection
by: Li, Sijie, et al.
Published: (2026)
by: Li, Sijie, et al.
Published: (2026)
FrontierCO: Real-World and Large-Scale Evaluation of Machine Learning Solvers for Combinatorial Optimization
by: Feng, Shengyu, et al.
Published: (2025)
by: Feng, Shengyu, et al.
Published: (2025)
Learning to Relax: Setting Solver Parameters Across a Sequence of Linear System Instances
by: Khodak, Mikhail, et al.
Published: (2023)
by: Khodak, Mikhail, et al.
Published: (2023)
CoMind: Towards Community-Driven Agents for Machine Learning Engineering
by: Li, Sijie, et al.
Published: (2025)
by: Li, Sijie, et al.
Published: (2025)
Multitask Learning Can Improve Worst-Group Outcomes
by: Kulkarni, Atharva, et al.
Published: (2023)
by: Kulkarni, Atharva, et al.
Published: (2023)
CodePDE: An Inference Framework for LLM-driven PDE Solver Generation
by: Li, Shanda, et al.
Published: (2025)
by: Li, Shanda, et al.
Published: (2025)
Where Does My Model Underperform? A Human Evaluation of Slice Discovery Algorithms
by: Johnson, Nari, et al.
Published: (2023)
by: Johnson, Nari, et al.
Published: (2023)
Pre-Generating Multi-Difficulty PDE Data for Few-Shot Neural PDE Solvers
by: Choudhary, Naman, et al.
Published: (2025)
by: Choudhary, Naman, et al.
Published: (2025)
Understanding Optimization in Deep Learning with Central Flows
by: Cohen, Jeremy M., et al.
Published: (2024)
by: Cohen, Jeremy M., et al.
Published: (2024)
Membership Inference Attacks for Unseen Classes
by: Thaker, Pratiksha, et al.
Published: (2025)
by: Thaker, Pratiksha, et al.
Published: (2025)
Learn Hard Problems During RL with Reference Guided Fine-tuning
by: Wu, Yangzhen, et al.
Published: (2026)
by: Wu, Yangzhen, et al.
Published: (2026)
What Happens When Small Is Made Smaller? Exploring the Impact of Compression on Small Data Pretrained Language Models
by: Awobade, Busayo, et al.
Published: (2024)
by: Awobade, Busayo, et al.
Published: (2024)
Sample Complexity and Representation Ability of Test-time Scaling Paradigms
by: Huang, Baihe, et al.
Published: (2025)
by: Huang, Baihe, et al.
Published: (2025)
Online Cascade Learning for Efficient Inference over Streams
by: Nie, Lunyiu, et al.
Published: (2024)
by: Nie, Lunyiu, et al.
Published: (2024)
Specialized Foundation Models Struggle to Beat Supervised Baselines
by: Xu, Zongzhe, et al.
Published: (2024)
by: Xu, Zongzhe, et al.
Published: (2024)
RECODE: Reasoning Through Code Generation for Visual Question Answering
by: Shen, Junhong, et al.
Published: (2025)
by: Shen, Junhong, et al.
Published: (2025)
Learning Personalized Decision Support Policies
by: Bhatt, Umang, et al.
Published: (2023)
by: Bhatt, Umang, et al.
Published: (2023)
ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response
by: Xie, Stephan, et al.
Published: (2026)
by: Xie, Stephan, et al.
Published: (2026)
Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction
by: Shen, Junhong, et al.
Published: (2025)
by: Shen, Junhong, et al.
Published: (2025)
CascadeServe: Unlocking Model Cascades for Inference Serving
by: Kossmann, Ferdi, et al.
Published: (2024)
by: Kossmann, Ferdi, et al.
Published: (2024)
Cascading and Proxy Membership Inference Attacks
by: Du, Yuntao, et al.
Published: (2025)
by: Du, Yuntao, et al.
Published: (2025)
Modulating Language Model Experiences through Frictions
by: Collins, Katherine M., et al.
Published: (2024)
by: Collins, Katherine M., et al.
Published: (2024)
Cascading Failure Prediction via Causal Inference
by: Ghosh, Shiuli Subhra, et al.
Published: (2024)
by: Ghosh, Shiuli Subhra, et al.
Published: (2024)
Cascade: Token-Sharded Private LLM Inference
by: Thomas, Rahul, et al.
Published: (2025)
by: Thomas, Rahul, et al.
Published: (2025)
Unlearning or Obfuscating? Jogging the Memory of Unlearned LLMs via Benign Relearning
by: Hu, Shengyuan, et al.
Published: (2024)
by: Hu, Shengyuan, et al.
Published: (2024)
HybridServe: Efficient Serving of Large AI Models with Confidence-Based Cascade Routing
by: Xue, Leyang, et al.
Published: (2025)
by: Xue, Leyang, et al.
Published: (2025)
Towards Interpretable and Efficient Feature Selection in Trajectory Datasets: A Taxonomic Approach
by: Samarasinghage, Chanuka Don, et al.
Published: (2025)
by: Samarasinghage, Chanuka Don, et al.
Published: (2025)
Cascade Speculative Drafting for Even Faster LLM Inference
by: Chen, Ziyi, et al.
Published: (2023)
by: Chen, Ziyi, et al.
Published: (2023)
Cascaded Flow Matching for Heterogeneous Tabular Data with Mixed-Type Features
by: Mueller, Markus, et al.
Published: (2026)
by: Mueller, Markus, et al.
Published: (2026)
Label-consistent clustering for evolving data
by: Gadekar, Ameet, et al.
Published: (2025)
by: Gadekar, Ameet, et al.
Published: (2025)
Push Smarter, Not Harder: Hierarchical RL-Diffusion Policy for Efficient Nonprehensile Manipulation
by: Caro, Steven, et al.
Published: (2025)
by: Caro, Steven, et al.
Published: (2025)
Grass: Compute Efficient Low-Memory LLM Training with Structured Sparse Gradients
by: Muhamed, Aashiq, et al.
Published: (2024)
by: Muhamed, Aashiq, et al.
Published: (2024)
ASMR: Activation-sharing Multi-resolution Coordinate Networks For Efficient Inference
by: Li, Jason Chun Lok, et al.
Published: (2024)
by: Li, Jason Chun Lok, et al.
Published: (2024)
R-Sparse: Rank-Aware Activation Sparsity for Efficient LLM Inference
by: Zhang, Zhenyu, et al.
Published: (2025)
by: Zhang, Zhenyu, et al.
Published: (2025)
Similar Items
-
Everybody Prune Now: Structured Pruning of LLMs with only Forward Passes
by: Kolawole, Steven, et al.
Published: (2024) -
UPS: Efficiently Building Foundation Models for PDE Solving via Cross-Modal Adaptation
by: Shen, Junhong, et al.
Published: (2024) -
Semantic Agreement Enables Efficient Open-Ended LLM Cascades
by: Soiffer, Duncan, et al.
Published: (2025) -
The Impact of Element Ordering on LM Agent Performance
by: Chi, Wayne, et al.
Published: (2024) -
PARALLELPROMPT: Extracting Parallelism from Large Language Model Queries
by: Kolawole, Steven, et al.
Published: (2025)