Recursive Inference Scaling: A Winning Path to Scalable Inference in Language and Multimodal Systems
Fuente:
arXiv
Salvato in:
| Autori principali: | Alabdulmohsin, Ibrahim, Zhai, Xiaohua |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
CLIP the Bias: How Useful is Balancing Data in Multimodal Learning?
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2024)
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2024)
Recursive Inference Machines for Neural Reasoning
di: Komisarczyk, Mieszko, et al.
Pubblicazione: (2026)
di: Komisarczyk, Mieszko, et al.
Pubblicazione: (2026)
UnIT: Scalable Unstructured Inference-Time Pruning for MAC-efficient Neural Inference on MCUs
di: Neth, Ashe, et al.
Pubblicazione: (2025)
di: Neth, Ashe, et al.
Pubblicazione: (2025)
Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2023)
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2023)
MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
di: Li, Bo, et al.
Pubblicazione: (2026)
di: Li, Bo, et al.
Pubblicazione: (2026)
Recursive Speculative Decoding: Accelerating LLM Inference via Sampling Without Replacement
di: Jeon, Wonseok, et al.
Pubblicazione: (2024)
di: Jeon, Wonseok, et al.
Pubblicazione: (2024)
Scaling Inference-Efficient Language Models
di: Bian, Song, et al.
Pubblicazione: (2025)
di: Bian, Song, et al.
Pubblicazione: (2025)
Large Language Monkeys: Scaling Inference Compute with Repeated Sampling
di: Brown, Bradley, et al.
Pubblicazione: (2024)
di: Brown, Bradley, et al.
Pubblicazione: (2024)
Generative Score Inference for Multimodal Data
di: Tian, Xinyu, et al.
Pubblicazione: (2026)
di: Tian, Xinyu, et al.
Pubblicazione: (2026)
Learning to Condition: A Neural Heuristic for Scalable MPE Inference
di: Malhotra, Brij, et al.
Pubblicazione: (2025)
di: Malhotra, Brij, et al.
Pubblicazione: (2025)
When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited
di: Agrawal, Rishabh, et al.
Pubblicazione: (2026)
di: Agrawal, Rishabh, et al.
Pubblicazione: (2026)
Consistency Models for Scalable and Fast Simulation-Based Inference
di: Schmitt, Marvin, et al.
Pubblicazione: (2023)
di: Schmitt, Marvin, et al.
Pubblicazione: (2023)
Context Parallelism for Scalable Million-Token Inference
di: Yang, Amy, et al.
Pubblicazione: (2024)
di: Yang, Amy, et al.
Pubblicazione: (2024)
Geometric Scaling of Bayesian Inference in LLMs
di: Agarwal, Naman, et al.
Pubblicazione: (2025)
di: Agarwal, Naman, et al.
Pubblicazione: (2025)
The Limits of Inference Scaling Through Resampling
di: Stroebl, Benedikt, et al.
Pubblicazione: (2024)
di: Stroebl, Benedikt, et al.
Pubblicazione: (2024)
Spectra 1.1: Scaling Laws and Efficient Inference for Ternary Language Models
di: Vaidhya, Tejas, et al.
Pubblicazione: (2025)
di: Vaidhya, Tejas, et al.
Pubblicazione: (2025)
Industrializing Prediction-Powered Inference: The GLIDE Library for Reliable GenAI and Agentic Systems Evaluation
di: Martinon, Grégoire, et al.
Pubblicazione: (2026)
di: Martinon, Grégoire, et al.
Pubblicazione: (2026)
Winning the MIDST Challenge: New Membership Inference Attacks on Diffusion Models for Tabular Data Synthesis
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
di: Wu, Xiaoyu, et al.
Pubblicazione: (2025)
Dynamic Expert Quantization for Scalable Mixture-of-Experts Inference
di: Chu, Kexin, et al.
Pubblicazione: (2025)
di: Chu, Kexin, et al.
Pubblicazione: (2025)
Scalable Simulation-Based Model Inference with Test-Time Complexity Control
di: Gloeckler, Manuel, et al.
Pubblicazione: (2026)
di: Gloeckler, Manuel, et al.
Pubblicazione: (2026)
Scalable AI Inference: Performance Analysis and Optimization of AI Model Serving
di: Pham, Hung Cuong, et al.
Pubblicazione: (2026)
di: Pham, Hung Cuong, et al.
Pubblicazione: (2026)
BlockBatch: Multi-Scale Consensus Decoding for Efficient Diffusion Language Model Inference
di: Wu, Xiaoyou, et al.
Pubblicazione: (2026)
di: Wu, Xiaoyou, et al.
Pubblicazione: (2026)
Sample, Scrutinize and Scale: Effective Inference-Time Search by Scaling Verification
di: Zhao, Eric, et al.
Pubblicazione: (2025)
di: Zhao, Eric, et al.
Pubblicazione: (2025)
Scaling On-Device GPU Inference for Large Generative Models
di: Tang, Jiuqiang, et al.
Pubblicazione: (2025)
di: Tang, Jiuqiang, et al.
Pubblicazione: (2025)
Diversified Scaling Inference in Time Series Foundation Models
di: Hua, Ruijin, et al.
Pubblicazione: (2026)
di: Hua, Ruijin, et al.
Pubblicazione: (2026)
Fuse It or Lose It: Deep Fusion for Multimodal Simulation-Based Inference
di: Schmitt, Marvin, et al.
Pubblicazione: (2023)
di: Schmitt, Marvin, et al.
Pubblicazione: (2023)
A Tale of Two Structures: Do LLMs Capture the Fractal Complexity of Language?
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2025)
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2025)
Rollout Roulette: A Probabilistic Inference Approach to Inference-Time Scaling of LLMs using Particle-Based Monte Carlo Methods
di: Puri, Isha, et al.
Pubblicazione: (2025)
di: Puri, Isha, et al.
Pubblicazione: (2025)
Polar Sparsity: High Throughput Batched LLM Inferencing with Scalable Contextual Sparsity
di: Shrestha, Susav, et al.
Pubblicazione: (2025)
di: Shrestha, Susav, et al.
Pubblicazione: (2025)
FSD-Inference: Fully Serverless Distributed Inference with Scalable Cloud Communication
di: Oakley, Joe, et al.
Pubblicazione: (2024)
di: Oakley, Joe, et al.
Pubblicazione: (2024)
Adaptive Inference-Time Scaling via Cyclic Diffusion Search
di: Lee, Gyubin, et al.
Pubblicazione: (2025)
di: Lee, Gyubin, et al.
Pubblicazione: (2025)
It Just Takes Two: Scaling Amortized Inference to Large Sets
di: Wehenkel, Antoine, et al.
Pubblicazione: (2026)
di: Wehenkel, Antoine, et al.
Pubblicazione: (2026)
Enabling Realtime Reinforcement Learning at Scale with Staggered Asynchronous Inference
di: Riemer, Matthew, et al.
Pubblicazione: (2024)
di: Riemer, Matthew, et al.
Pubblicazione: (2024)
Fast Inference for Augmented Large Language Models
di: Shahout, Rana, et al.
Pubblicazione: (2024)
di: Shahout, Rana, et al.
Pubblicazione: (2024)
Out of Context: Reliability in Multimodal Anomaly Detection Requires Contextual Inference
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2026)
di: Wilkinghoff, Kevin, et al.
Pubblicazione: (2026)
A Simple Model of Inference Scaling Laws
di: Levi, Noam
Pubblicazione: (2024)
di: Levi, Noam
Pubblicazione: (2024)
Learning to Inference Adaptively for Multimodal Large Language Models
di: Xu, Zhuoyan, et al.
Pubblicazione: (2025)
di: Xu, Zhuoyan, et al.
Pubblicazione: (2025)
Mini-Giants: "Small" Language Models and Open Source Win-Win
di: Zhou, Zhengping, et al.
Pubblicazione: (2023)
di: Zhou, Zhengping, et al.
Pubblicazione: (2023)
DeeR-VLA: Dynamic Inference of Multimodal Large Language Models for Efficient Robot Execution
di: Yue, Yang, et al.
Pubblicazione: (2024)
di: Yue, Yang, et al.
Pubblicazione: (2024)
Find A Winning Sign: Sign Is All We Need to Win the Lottery
di: Oh, Junghun, et al.
Pubblicazione: (2025)
di: Oh, Junghun, et al.
Pubblicazione: (2025)
Documenti analoghi
-
CLIP the Bias: How Useful is Balancing Data in Multimodal Learning?
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2024) -
Recursive Inference Machines for Neural Reasoning
di: Komisarczyk, Mieszko, et al.
Pubblicazione: (2026) -
UnIT: Scalable Unstructured Inference-Time Pruning for MAC-efficient Neural Inference on MCUs
di: Neth, Ashe, et al.
Pubblicazione: (2025) -
Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design
di: Alabdulmohsin, Ibrahim, et al.
Pubblicazione: (2023) -
MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference
di: Li, Bo, et al.
Pubblicazione: (2026)