Efficient Reasoning on the Edge
Fuente:
arXiv
Guardado en:
| Autores principales: | Bondarenko, Yelysei, Hehn, Thomas, Hesselink, Rob, Lepert, Romain, Massoli, Fabio Valerio, Mironov, Evgeny, Mirvakhabova, Leyla, Orekondy, Tribhuvanesh, Stasis, Spyridon, Kuzmin, Andrey, Kuzina, Anna, Nagel, Markus, Nayak, Ankita, Rainone, Corrado, de Rooij, Ork, Whatmough, Paul N, Behboodi, Arash, Bejnordi, Babak Ehteshami |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Simulating, Fast and Slow: Learning Policies for Black-Box Optimization
por: Massoli, Fabio Valerio, et al.
Publicado: (2024)
por: Massoli, Fabio Valerio, et al.
Publicado: (2024)
LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents
por: Rakhsha, Amin, et al.
Publicado: (2026)
por: Rakhsha, Amin, et al.
Publicado: (2026)
Dirichlet-Prior Shaping: Guiding Expert Specialization in Upcycled MoEs
por: Mirvakhabova, Leyla, et al.
Publicado: (2025)
por: Mirvakhabova, Leyla, et al.
Publicado: (2025)
Differentiable and Learnable Wireless Simulation with Geometric Transformers
por: Hehn, Thomas, et al.
Publicado: (2024)
por: Hehn, Thomas, et al.
Publicado: (2024)
KaVa: Latent Reasoning via Compressed KV-Cache Distillation
por: Kuzina, Anna, et al.
Publicado: (2025)
por: Kuzina, Anna, et al.
Publicado: (2025)
Reinforcement Learning of Adaptive Acquisition Policies for Inverse Problems
por: Silvestri, Gianluigi, et al.
Publicado: (2024)
por: Silvestri, Gianluigi, et al.
Publicado: (2024)
FPTQuant: Function-Preserving Transforms for LLM Quantization
por: van Breugel, Boris, et al.
Publicado: (2025)
por: van Breugel, Boris, et al.
Publicado: (2025)
Mixture of Cache-Conditional Experts for Efficient Mobile Device Inference
por: Skliar, Andrii, et al.
Publicado: (2024)
por: Skliar, Andrii, et al.
Publicado: (2024)
LaneRoPE: Positional Encoding for Collaborative Parallel Reasoning and Generation
por: Cesa, Gabriele, et al.
Publicado: (2026)
por: Cesa, Gabriele, et al.
Publicado: (2026)
Reasoning as Compression: Unifying Budget Forcing via the Conditional Information Bottleneck
por: Massoli, Fabio Valerio, et al.
Publicado: (2026)
por: Massoli, Fabio Valerio, et al.
Publicado: (2026)
Low-Rank Quantization-Aware Training for LLMs
por: Bondarenko, Yelysei, et al.
Publicado: (2024)
por: Bondarenko, Yelysei, et al.
Publicado: (2024)
When Cloud Agents Meet Device Agents: Lessons from Hybrid Multi-Agent Systems
por: Rainone, Corrado, et al.
Publicado: (2026)
por: Rainone, Corrado, et al.
Publicado: (2026)
Variational Learning ISTA
por: Massoli, Fabio Valerio, et al.
Publicado: (2024)
por: Massoli, Fabio Valerio, et al.
Publicado: (2024)
Replacing thinking with tool usage enables reasoning in small language models
por: Rainone, Corrado, et al.
Publicado: (2025)
por: Rainone, Corrado, et al.
Publicado: (2025)
Pruning vs Quantization: Which is Better?
por: Kuzmin, Andrey, et al.
Publicado: (2023)
por: Kuzmin, Andrey, et al.
Publicado: (2023)
Fundamental bounds on efficiency-confidence trade-off for transductive conformal prediction
por: Behboodi, Arash, et al.
Publicado: (2025)
por: Behboodi, Arash, et al.
Publicado: (2025)
An Information Theoretic Perspective on Conformal Prediction
por: Correia, Alvaro H. C., et al.
Publicado: (2024)
por: Correia, Alvaro H. C., et al.
Publicado: (2024)
Numerical study of plasma behavior in a disk‐shaped noble gas MHD generator
por: Ork Kimsor, et al.
Publicado: (2024)
por: Ork Kimsor, et al.
Publicado: (2024)
Vision-Assisted Digital Twin Creation for mmWave Beam Management
por: Arnold, Maximilian, et al.
Publicado: (2024)
por: Arnold, Maximilian, et al.
Publicado: (2024)
Neural Mesh Fusion: Unsupervised 3D Planar Surface Understanding
por: Zanjani, Farhad G., et al.
Publicado: (2024)
por: Zanjani, Farhad G., et al.
Publicado: (2024)
Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding
por: Bergner, Benjamin, et al.
Publicado: (2024)
por: Bergner, Benjamin, et al.
Publicado: (2024)
InterroGate: Learning to Share, Specialize, and Prune Representations for Multi-task Learning
por: Bejnordi, Babak Ehteshami, et al.
Publicado: (2024)
por: Bejnordi, Babak Ehteshami, et al.
Publicado: (2024)
Human-in-the-loop Reasoning For Traffic Sign Detection: Collaborative Approach Yolo With Video-llava
por: Azarafza, Mehdi, et al.
Publicado: (2024)
por: Azarafza, Mehdi, et al.
Publicado: (2024)
Dissecting Quantization Error: A Concentration-Alignment Perspective
por: Federici, Marco, et al.
Publicado: (2026)
por: Federici, Marco, et al.
Publicado: (2026)
Modelling Territorial Dynamics through Statistical Mechanics: An Application to Resident Foreign Population
por: Massoli, Pierpaolo
Publicado: (2025)
por: Massoli, Pierpaolo
Publicado: (2025)
Unveiling Complex Territorial Socio-Economic Dynamics: A Statistical Mechanics Approach
por: Massoli, Pierpaolo
Publicado: (2025)
por: Massoli, Pierpaolo
Publicado: (2025)
Learning Optical Flow Field via Neural Ordinary Differential Equation
por: Mirvakhabova, Leyla, et al.
Publicado: (2025)
por: Mirvakhabova, Leyla, et al.
Publicado: (2025)
Healers on the colonial market; Native doctors and midwives in the Dutch East Indies
por: Hesselink, Liesbeth
Publicado: (2011)
por: Hesselink, Liesbeth
Publicado: (2011)
Development of a College Success Management Course for York County Technical College.
por: Rainone, John J.
Publicado: (1997)
por: Rainone, John J.
Publicado: (1997)
GPTVQ: The Blessing of Dimensionality for LLM Quantization
por: van Baalen, Mart, et al.
Publicado: (2024)
por: van Baalen, Mart, et al.
Publicado: (2024)
AS MUDANÇAS LEGAIS NO AMBIENTE INSTITUCIONAL DO SETOR DE EDUCAÇÃO E AS ESTRATÉGIAS DE CRESCIMENTO DE UMA INSTITUIÇÃO DE ENSINO SUPERIOR
por: Renata Massoli Borges
Publicado: (2013)
por: Renata Massoli Borges
Publicado: (2013)
AN ANTI-CHRISTIAN REGISTER FROM NAGASAKI
por: Reinier H. Hesselink
Publicado: (2009)
por: Reinier H. Hesselink
Publicado: (2009)
Read-ME: Refactorizing LLMs as Router-Decoupled Mixture of Experts with System Co-Design
por: Cai, Ruisi, et al.
Publicado: (2024)
por: Cai, Ruisi, et al.
Publicado: (2024)
Memory-Efficient Looped Transformer: Decoupling Compute from Memory in Looped Language Models
por: Vendrell, Victor Conchello, et al.
Publicado: (2026)
por: Vendrell, Victor Conchello, et al.
Publicado: (2026)
Hierarchical VAE with a Diffusion-based VampPrior
por: Kuzina, Anna, et al.
Publicado: (2024)
por: Kuzina, Anna, et al.
Publicado: (2024)
STaMP: Sequence Transformation and Mixed Precision for Low-Precision Activation Quantization
por: Federici, Marco, et al.
Publicado: (2025)
por: Federici, Marco, et al.
Publicado: (2025)
HadaNorm: Diffusion Transformer Quantization through Mean-Centered Transformations
por: Federici, Marco, et al.
Publicado: (2025)
por: Federici, Marco, et al.
Publicado: (2025)
Preliminary survey on the relationship between dimensions of pinctada radiata in Moqam
por: Ehteshami, Fariborz.
Publicado: (1994)
por: Ehteshami, Fariborz.
Publicado: (1994)
Anesthetizing Pinctada radiata with MS-222
por: Ehteshami, Fariborz
Publicado: (1993)
por: Ehteshami, Fariborz
Publicado: (1993)
Trendbericht Theoretische Chemie 2025 2/2: Theoretische Spektroskopie
por: Anna Hehn
Publicado: (2025)
por: Anna Hehn
Publicado: (2025)
Ejemplares similares
-
Simulating, Fast and Slow: Learning Policies for Black-Box Optimization
por: Massoli, Fabio Valerio, et al.
Publicado: (2024) -
LUMINA: Long-horizon Understanding for Multi-turn Interactive Agents
por: Rakhsha, Amin, et al.
Publicado: (2026) -
Dirichlet-Prior Shaping: Guiding Expert Specialization in Upcycled MoEs
por: Mirvakhabova, Leyla, et al.
Publicado: (2025) -
Differentiable and Learnable Wireless Simulation with Geometric Transformers
por: Hehn, Thomas, et al.
Publicado: (2024) -
KaVa: Latent Reasoning via Compressed KV-Cache Distillation
por: Kuzina, Anna, et al.
Publicado: (2025)