Enregistré dans:
| Auteur principal: | Liu, Yi |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2605.03379 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Maximize Your Data's Potential: Enhancing LLM Accuracy with Two-Phase Pretraining
par: Feng, Steven, et autres
Publié: (2024)
par: Feng, Steven, et autres
Publié: (2024)
Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning
par: Wei, Lei, et autres
Publié: (2026)
par: Wei, Lei, et autres
Publié: (2026)
Enhancing Accuracy and Maintainability in Nuclear Plant Data Retrieval: A Function-Calling LLM Approach Over NL-to-SQL
par: de Costa, Mishca, et autres
Publié: (2025)
par: de Costa, Mishca, et autres
Publié: (2025)
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
par: Behnam, Payman, et autres
Publié: (2025)
par: Behnam, Payman, et autres
Publié: (2025)
VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference
par: Qi, Jasmine, et autres
Publié: (2026)
par: Qi, Jasmine, et autres
Publié: (2026)
Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control
par: Li, Bolian, et autres
Publié: (2026)
par: Li, Bolian, et autres
Publié: (2026)
Sustainable LLM Inference for Edge AI: Evaluating Quantized LLMs for Energy Efficiency, Output Accuracy, and Inference Latency
par: Husom, Erik Johannes, et autres
Publié: (2025)
par: Husom, Erik Johannes, et autres
Publié: (2025)
ToolACE: Winning the Points of LLM Function Calling
par: Liu, Weiwen, et autres
Publié: (2024)
par: Liu, Weiwen, et autres
Publié: (2024)
Two-stage LLM Fine-tuning with Less Specialization and More Generalization
par: Wang, Yihan, et autres
Publié: (2022)
par: Wang, Yihan, et autres
Publié: (2022)
Lexical Hints of Accuracy in LLM Reasoning Chains
par: Vanhoyweghen, Arne, et autres
Publié: (2025)
par: Vanhoyweghen, Arne, et autres
Publié: (2025)
Two Birds with One Stone: Multi-Task Detection and Attribution of LLM-Generated Text
par: Rao, Zixin, et autres
Publié: (2025)
par: Rao, Zixin, et autres
Publié: (2025)
Are More LLM Calls All You Need? Towards Scaling Laws of Compound Inference Systems
par: Chen, Lingjiao, et autres
Publié: (2024)
par: Chen, Lingjiao, et autres
Publié: (2024)
DuoGuard: A Two-Player RL-Driven Framework for Multilingual LLM Guardrails
par: Deng, Yihe, et autres
Publié: (2025)
par: Deng, Yihe, et autres
Publié: (2025)
Large Language Models as Agents in Two-Player Games
par: Liu, Yang, et autres
Publié: (2024)
par: Liu, Yang, et autres
Publié: (2024)
From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization
par: Zhou, Chenxi, et autres
Publié: (2026)
par: Zhou, Chenxi, et autres
Publié: (2026)
LoopTool: Closing the Data-Training Loop for Robust LLM Tool Calls
par: Zhang, Kangning, et autres
Publié: (2025)
par: Zhang, Kangning, et autres
Publié: (2025)
ToVo: Toxicity Taxonomy via Voting
par: Luong, Tinh Son, et autres
Publié: (2024)
par: Luong, Tinh Son, et autres
Publié: (2024)
Incremental Sequence Labeling: A Tale of Two Shifts
par: Qiu, Shengjie, et autres
Publié: (2024)
par: Qiu, Shengjie, et autres
Publié: (2024)
EvasionBench: A Large-Scale Benchmark for Detecting Managerial Evasion in Earnings Call Q&A
par: Ma, Shijian, et autres
Publié: (2026)
par: Ma, Shijian, et autres
Publié: (2026)
Two Minds Better Than One: Collaborative Reward Modeling for LLM Alignment
par: Zhang, Jiazheng, et autres
Publié: (2025)
par: Zhang, Jiazheng, et autres
Publié: (2025)
Reject, Resample, Repeat: Understanding Parallel Reasoning in Language Model Inference
par: Golowich, Noah, et autres
Publié: (2026)
par: Golowich, Noah, et autres
Publié: (2026)
Universal Model Routing for Efficient LLM Inference
par: Jitkrittum, Wittawat, et autres
Publié: (2025)
par: Jitkrittum, Wittawat, et autres
Publié: (2025)
It Takes Two: Your GRPO Is Secretly DPO
par: Wu, Yihong, et autres
Publié: (2025)
par: Wu, Yihong, et autres
Publié: (2025)
DASH: Input-Aware Dynamic Layer Skipping for Efficient LLM Inference with Markov Decision Policies
par: Yang, Ning, et autres
Publié: (2025)
par: Yang, Ning, et autres
Publié: (2025)
Identifying Factual Inconsistencies in Summaries: Grounding LLM Inference via Task Taxonomy
par: Xu, Liyan, et autres
Publié: (2024)
par: Xu, Liyan, et autres
Publié: (2024)
TinyAgent: Function Calling at the Edge
par: Erdogan, Lutfi Eren, et autres
Publié: (2024)
par: Erdogan, Lutfi Eren, et autres
Publié: (2024)
SUMO: Subspace-Aware Moment-Orthogonalization for Accelerating Memory-Efficient LLM Training
par: Refael, Yehonathan, et autres
Publié: (2025)
par: Refael, Yehonathan, et autres
Publié: (2025)
Faster LLM Inference via Sequential Monte Carlo
par: Emara, Yahya, et autres
Publié: (2026)
par: Emara, Yahya, et autres
Publié: (2026)
CHAI: Clustered Head Attention for Efficient LLM Inference
par: Agarwal, Saurabh, et autres
Publié: (2024)
par: Agarwal, Saurabh, et autres
Publié: (2024)
Cascade Speculative Drafting for Even Faster LLM Inference
par: Chen, Ziyi, et autres
Publié: (2023)
par: Chen, Ziyi, et autres
Publié: (2023)
Progressive Mixed-Precision Decoding for Efficient LLM Inference
par: Chen, Hao Mark, et autres
Publié: (2024)
par: Chen, Hao Mark, et autres
Publié: (2024)
PoTPTQ: A Two-step Power-of-Two Post-training for LLMs
par: Wang, Xinyu, et autres
Publié: (2025)
par: Wang, Xinyu, et autres
Publié: (2025)
KeepKV: Achieving Periodic Lossless KV Cache Compression for Efficient LLM Inference
par: Tian, Yuxuan, et autres
Publié: (2025)
par: Tian, Yuxuan, et autres
Publié: (2025)
RetrievalAttention: Accelerating Long-Context LLM Inference via Vector Retrieval
par: Liu, Di, et autres
Publié: (2024)
par: Liu, Di, et autres
Publié: (2024)
Non-Linear Inference Time Intervention: Improving LLM Truthfulness
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
Faster MoE LLM Inference for Extremely Large Models
par: Yang, Haoqi, et autres
Publié: (2025)
par: Yang, Haoqi, et autres
Publié: (2025)
Megalodon: Efficient LLM Pretraining and Inference with Unlimited Context Length
par: Ma, Xuezhe, et autres
Publié: (2024)
par: Ma, Xuezhe, et autres
Publié: (2024)
Break the Sequential Dependency of LLM Inference Using Lookahead Decoding
par: Fu, Yichao, et autres
Publié: (2024)
par: Fu, Yichao, et autres
Publié: (2024)
Hogwild! Inference: Parallel LLM Generation via Concurrent Attention
par: Rodionov, Gleb, et autres
Publié: (2025)
par: Rodionov, Gleb, et autres
Publié: (2025)
Inference time LLM alignment in single and multidomain preference spectrum
par: Shahriar, Sadat, et autres
Publié: (2024)
par: Shahriar, Sadat, et autres
Publié: (2024)
Documents similaires
-
Maximize Your Data's Potential: Enhancing LLM Accuracy with Two-Phase Pretraining
par: Feng, Steven, et autres
Publié: (2024) -
Think-Augmented Function Calling: Improving LLM Parameter Accuracy Through Embedded Reasoning
par: Wei, Lei, et autres
Publié: (2026) -
Enhancing Accuracy and Maintainability in Nuclear Plant Data Retrieval: A Function-Calling LLM Approach Over NL-to-SQL
par: de Costa, Mishca, et autres
Publié: (2025) -
RocketKV: Accelerating Long-Context LLM Inference via Two-Stage KV Cache Compression
par: Behnam, Payman, et autres
Publié: (2025) -
VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference
par: Qi, Jasmine, et autres
Publié: (2026)