Guardado en:
| Autores principales: | Nie, Lunyiu, Ding, Zhimin, Hu, Erdong, Jermaine, Christopher, Chaudhuri, Swarat |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2402.04513 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Resource-efficient Inference with Foundation Model Programs
por: Nie, Lunyiu, et al.
Publicado: (2025)
por: Nie, Lunyiu, et al.
Publicado: (2025)
Batched Low-Rank Adaptation of Foundation Models
por: Wen, Yeming, et al.
Publicado: (2023)
por: Wen, Yeming, et al.
Publicado: (2023)
Learning Quantitative Automata Modulo Theories
por: Hsiung, Eric, et al.
Publicado: (2024)
por: Hsiung, Eric, et al.
Publicado: (2024)
When Parallelism Pays Off: Cohesion-Aware Task Partitioning for Multi-Agent Coding
por: Yang, Xu, et al.
Publicado: (2026)
por: Yang, Xu, et al.
Publicado: (2026)
Prompt Tuning Strikes Back: Customizing Foundation Models with Low-Rank Prompt Adaptation
por: Jain, Abhinav, et al.
Publicado: (2024)
por: Jain, Abhinav, et al.
Publicado: (2024)
Efficient Tree-Structured Deep Research with Adaptive Resource Allocation
por: Nie, Lunyiu, et al.
Publicado: (2025)
por: Nie, Lunyiu, et al.
Publicado: (2025)
An In-Context Learning Agent for Formal Theorem-Proving
por: Thakur, Amitayush, et al.
Publicado: (2023)
por: Thakur, Amitayush, et al.
Publicado: (2023)
ProofWala: A Framework for Multilingual Proof Data Synthesis and Theorem-Proving
por: Thakur, Amitayush, et al.
Publicado: (2025)
por: Thakur, Amitayush, et al.
Publicado: (2025)
PutnamBench: Evaluating Neural Theorem-Provers on the Putnam Mathematical Competition
por: Tsoukalas, George, et al.
Publicado: (2024)
por: Tsoukalas, George, et al.
Publicado: (2024)
Are More Tokens Rational? Inference-Time Scaling in Language Models as Adaptive Resource Rationality
por: Hu, Zhimin, et al.
Publicado: (2026)
por: Hu, Zhimin, et al.
Publicado: (2026)
RAG-Modulo: Solving Sequential Tasks using Experience, Critics, and Language Models
por: Jain, Abhinav, et al.
Publicado: (2024)
por: Jain, Abhinav, et al.
Publicado: (2024)
Why Code, Why Now: An Information-Theoretic Perspective on the Limits of Machine Learning
por: Zhao, Zhimin
Publicado: (2026)
por: Zhao, Zhimin
Publicado: (2026)
Automata Learning from Preference and Equivalence Queries
por: Hsiung, Eric, et al.
Publicado: (2023)
por: Hsiung, Eric, et al.
Publicado: (2023)
Synthesize, Partition, then Adapt: Eliciting Diverse Samples from Foundation Models
por: Wen, Yeming, et al.
Publicado: (2024)
por: Wen, Yeming, et al.
Publicado: (2024)
Cascade Speculative Drafting for Even Faster LLM Inference
por: Chen, Ziyi, et al.
Publicado: (2023)
por: Chen, Ziyi, et al.
Publicado: (2023)
Grounding Data Science Code Generation with Input-Output Specifications
por: Wen, Yeming, et al.
Publicado: (2024)
por: Wen, Yeming, et al.
Publicado: (2024)
ChunkFT: Byte-Streamed Optimization for Memory-Efficient Full Fine-Tuning
por: Liu, Yongkang, et al.
Publicado: (2026)
por: Liu, Yongkang, et al.
Publicado: (2026)
Learning-Time Encoding Shapes Unlearning in LLMs
por: Wu, Ruihan, et al.
Publicado: (2025)
por: Wu, Ruihan, et al.
Publicado: (2025)
Inference-Cost-Aware Dynamic Tree Construction for Efficient Inference in Large Language Models
por: Hong, Yinrong, et al.
Publicado: (2025)
por: Hong, Yinrong, et al.
Publicado: (2025)
GRASP: A Rehearsal Policy for Efficient Online Continual Learning
por: Harun, Md Yousuf, et al.
Publicado: (2023)
por: Harun, Md Yousuf, et al.
Publicado: (2023)
Cascade Reward Sampling for Efficient Decoding-Time Alignment
por: Li, Bolian, et al.
Publicado: (2024)
por: Li, Bolian, et al.
Publicado: (2024)
Star Attention: Efficient LLM Inference over Long Sequences
por: Acharya, Shantanu, et al.
Publicado: (2024)
por: Acharya, Shantanu, et al.
Publicado: (2024)
Navigating the Minefield of MT Beam Search in Cascaded Streaming Speech Translation
por: Rabatin, Rastislav, et al.
Publicado: (2024)
por: Rabatin, Rastislav, et al.
Publicado: (2024)
Symbolic Regression with a Learned Concept Library
por: Grayeli, Arya, et al.
Publicado: (2024)
por: Grayeli, Arya, et al.
Publicado: (2024)
Efficient Contextual LLM Cascades through Budget-Constrained Policy Learning
por: Zhang, Xuechen, et al.
Publicado: (2024)
por: Zhang, Xuechen, et al.
Publicado: (2024)
A Probabilistic Framework for Modular Continual Learning
por: Valkov, Lazar, et al.
Publicado: (2023)
por: Valkov, Lazar, et al.
Publicado: (2023)
CLEVER: A Curated Benchmark for Formally Verified Code Generation
por: Thakur, Amitayush, et al.
Publicado: (2025)
por: Thakur, Amitayush, et al.
Publicado: (2025)
Sample-Efficient Online Learning in LM Agents via Hindsight Trajectory Rewriting
por: Hu, Michael Y., et al.
Publicado: (2025)
por: Hu, Michael Y., et al.
Publicado: (2025)
REA-RL: Reflection-Aware Online Reinforcement Learning for Efficient Reasoning
por: Deng, Hexuan, et al.
Publicado: (2025)
por: Deng, Hexuan, et al.
Publicado: (2025)
PHONOS: PHOnetic Neutralization for Online Streaming Applications
por: Quamer, Waris, et al.
Publicado: (2026)
por: Quamer, Waris, et al.
Publicado: (2026)
Efficient Learned Data Compression via Dual-Stream Feature Decoupling
por: Ma, Huidong, et al.
Publicado: (2026)
por: Ma, Huidong, et al.
Publicado: (2026)
Speculative Streaming: Fast LLM Inference without Auxiliary Models
por: Bhendawade, Nikhil, et al.
Publicado: (2024)
por: Bhendawade, Nikhil, et al.
Publicado: (2024)
OPTune: Efficient Online Preference Tuning
por: Chen, Lichang, et al.
Publicado: (2024)
por: Chen, Lichang, et al.
Publicado: (2024)
Nemotron-Cascade: Scaling Cascaded Reinforcement Learning for General-Purpose Reasoning Models
por: Wang, Boxin, et al.
Publicado: (2025)
por: Wang, Boxin, et al.
Publicado: (2025)
Ltri-LLM: Streaming Long Context Inference for LLMs with Training-Free Dynamic Triangular Attention Pattern
por: Tang, Hongyin, et al.
Publicado: (2024)
por: Tang, Hongyin, et al.
Publicado: (2024)
DOPPLER: Dual-Policy Learning for Device Assignment in Asynchronous Dataflow Graphs
por: Yao, Xinyu, et al.
Publicado: (2025)
por: Yao, Xinyu, et al.
Publicado: (2025)
zip2zip: Inference-Time Adaptive Tokenization via Online Compression
por: Geng, Saibo, et al.
Publicado: (2025)
por: Geng, Saibo, et al.
Publicado: (2025)
Self-Evolving Visual Concept Library using Vision-Language Critics
por: Sehgal, Atharva, et al.
Publicado: (2025)
por: Sehgal, Atharva, et al.
Publicado: (2025)
Universal Model Routing for Efficient LLM Inference
por: Jitkrittum, Wittawat, et al.
Publicado: (2025)
por: Jitkrittum, Wittawat, et al.
Publicado: (2025)
Deterministic Inference across Tensor Parallel Sizes That Eliminates Training-Inference Mismatch
por: Zhang, Ziyang, et al.
Publicado: (2025)
por: Zhang, Ziyang, et al.
Publicado: (2025)
Ejemplares similares
-
Resource-efficient Inference with Foundation Model Programs
por: Nie, Lunyiu, et al.
Publicado: (2025) -
Batched Low-Rank Adaptation of Foundation Models
por: Wen, Yeming, et al.
Publicado: (2023) -
Learning Quantitative Automata Modulo Theories
por: Hsiung, Eric, et al.
Publicado: (2024) -
When Parallelism Pays Off: Cohesion-Aware Task Partitioning for Multi-Agent Coding
por: Yang, Xu, et al.
Publicado: (2026) -
Prompt Tuning Strikes Back: Customizing Foundation Models with Low-Rank Prompt Adaptation
por: Jain, Abhinav, et al.
Publicado: (2024)