TRIM: Token Reduction and Inference Modeling for Cost-Effective Language Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Ruiz, Alfredo Garrachón, de la Rosa, Tomás, Borrajo, Daniel |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
On the Temporal Question-Answering Capabilities of Large Language Models Over Anonymized Data
di: Ruiz, Alfredo Garrachón, et al.
Pubblicazione: (2025)
di: Ruiz, Alfredo Garrachón, et al.
Pubblicazione: (2025)
Methods for Matching English Language Addresses
di: Ramani, Keshav, et al.
Pubblicazione: (2024)
di: Ramani, Keshav, et al.
Pubblicazione: (2024)
Thinking Tokens for Language Modeling
di: Herel, David, et al.
Pubblicazione: (2024)
di: Herel, David, et al.
Pubblicazione: (2024)
TRIM: Token-wise Attention-Derived Saliency for Data-Efficient Instruction Tuning
di: Nagaraj, Manish, et al.
Pubblicazione: (2025)
di: Nagaraj, Manish, et al.
Pubblicazione: (2025)
Effective Large Language Model Adaptation for Improved Grounding and Citation Generation
di: Ye, Xi, et al.
Pubblicazione: (2023)
di: Ye, Xi, et al.
Pubblicazione: (2023)
DynaMo: Accelerating Language Model Inference with Dynamic Multi-Token Sampling
di: Tuli, Shikhar, et al.
Pubblicazione: (2024)
di: Tuli, Shikhar, et al.
Pubblicazione: (2024)
Memory Tokens: Large Language Models Can Generate Reversible Sentence Embeddings
di: Sastre, Ignacio, et al.
Pubblicazione: (2025)
di: Sastre, Ignacio, et al.
Pubblicazione: (2025)
VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models
di: Zhang, Ce, et al.
Pubblicazione: (2025)
di: Zhang, Ce, et al.
Pubblicazione: (2025)
Evaluating the Effectiveness of Cost-Efficient Large Language Models in Benchmark Biomedical Tasks
di: Jahan, Israt, et al.
Pubblicazione: (2025)
di: Jahan, Israt, et al.
Pubblicazione: (2025)
CamemBERT-bio: Leveraging Continual Pre-training for Cost-Effective Models on French Biomedical Data
di: Touchent, Rian, et al.
Pubblicazione: (2023)
di: Touchent, Rian, et al.
Pubblicazione: (2023)
TRIM: Hybrid Inference via Targeted Stepwise Routing in Multi-Step Reasoning Tasks
di: Kapoor, Vansh, et al.
Pubblicazione: (2026)
di: Kapoor, Vansh, et al.
Pubblicazione: (2026)
Inference-Cost-Aware Dynamic Tree Construction for Efficient Inference in Large Language Models
di: Hong, Yinrong, et al.
Pubblicazione: (2025)
di: Hong, Yinrong, et al.
Pubblicazione: (2025)
Compressed-Sensing-Guided, Inference-Aware Structured Reduction for Large Language Models
di: Kiruluta, Andrew
Pubblicazione: (2026)
di: Kiruluta, Andrew
Pubblicazione: (2026)
Glitch Tokens in Large Language Models: Categorization Taxonomy and Effective Detection
di: Li, Yuxi, et al.
Pubblicazione: (2024)
di: Li, Yuxi, et al.
Pubblicazione: (2024)
LFTR: Learning-Free Token Reduction for Multimodal Large Language Models
di: Zhao, Zihui, et al.
Pubblicazione: (2025)
di: Zhao, Zihui, et al.
Pubblicazione: (2025)
LLM Cache Bandit Revisited: Addressing Query Heterogeneity for Cost-Effective LLM Inference
di: Yang, Hantao, et al.
Pubblicazione: (2025)
di: Yang, Hantao, et al.
Pubblicazione: (2025)
LoPT: Lossless Parallel Tokenization Acceleration for Long Context Inference of Large Language Model
di: Shao, Wei, et al.
Pubblicazione: (2025)
di: Shao, Wei, et al.
Pubblicazione: (2025)
Rethinking Token Reduction for State Space Models
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
di: Zhan, Zheng, et al.
Pubblicazione: (2024)
Specialised or Generic? Tokenization Choices for Radiology Language Models
di: Warr, Hermione, et al.
Pubblicazione: (2025)
di: Warr, Hermione, et al.
Pubblicazione: (2025)
Turning Trash into Treasure: Accelerating Inference of Large Language Models with Token Recycling
di: Luo, Xianzhen, et al.
Pubblicazione: (2024)
di: Luo, Xianzhen, et al.
Pubblicazione: (2024)
Hey, That's My Data! Token-Only Dataset Inference in Large Language Models
di: Xiong, Chen, et al.
Pubblicazione: (2025)
di: Xiong, Chen, et al.
Pubblicazione: (2025)
Problematic Tokens: Tokenizer Bias in Large Language Models
di: Yang, Jin, et al.
Pubblicazione: (2024)
di: Yang, Jin, et al.
Pubblicazione: (2024)
Cequel: Cost-Effective Querying of Large Language Models for Text Clustering
di: Wang, Hongtao, et al.
Pubblicazione: (2025)
di: Wang, Hongtao, et al.
Pubblicazione: (2025)
LVPruning: An Effective yet Simple Language-Guided Vision Token Pruning Approach for Multi-modal Large Language Models
di: Sun, Yizheng, et al.
Pubblicazione: (2025)
di: Sun, Yizheng, et al.
Pubblicazione: (2025)
Tokens for Learning, Tokens for Unlearning: Mitigating Membership Inference Attacks in Large Language Models via Dual-Purpose Training
di: Tran, Toan, et al.
Pubblicazione: (2025)
di: Tran, Toan, et al.
Pubblicazione: (2025)
Large Multimodal Agents for Accurate Phishing Detection with Enhanced Token Optimization and Cost Reduction
di: Trad, Fouad, et al.
Pubblicazione: (2024)
di: Trad, Fouad, et al.
Pubblicazione: (2024)
Rethinking Tokenization: Crafting Better Tokenizers for Large Language Models
di: Yang, Jinbiao
Pubblicazione: (2024)
di: Yang, Jinbiao
Pubblicazione: (2024)
Detecting Hallucinations in Large Language Model Generation: A Token Probability Approach
di: Quevedo, Ernesto, et al.
Pubblicazione: (2024)
di: Quevedo, Ernesto, et al.
Pubblicazione: (2024)
Predicting Rewards Alongside Tokens: Non-disruptive Parameter Insertion for Efficient Inference Intervention in Large Language Model
di: Yuan, Chenhan, et al.
Pubblicazione: (2024)
di: Yuan, Chenhan, et al.
Pubblicazione: (2024)
PromptDistill: Query-based Selective Token Retention in Intermediate Layers for Efficient Large Language Model Inference
di: Jin, Weisheng, et al.
Pubblicazione: (2025)
di: Jin, Weisheng, et al.
Pubblicazione: (2025)
GlitchProber: Advancing Effective Detection and Mitigation of Glitch Tokens in Large Language Models
di: Zhang, Zhibo, et al.
Pubblicazione: (2024)
di: Zhang, Zhibo, et al.
Pubblicazione: (2024)
Scaffold-BPE: Enhancing Byte Pair Encoding for Large Language Models with Simple and Effective Scaffold Token Removal
di: Lian, Haoran, et al.
Pubblicazione: (2024)
di: Lian, Haoran, et al.
Pubblicazione: (2024)
Disentangling Reasoning Tokens and Boilerplate Tokens For Language Model Fine-tuning
di: Ye, Ziang, et al.
Pubblicazione: (2024)
di: Ye, Ziang, et al.
Pubblicazione: (2024)
Estimating Knowledge in Large Language Models Without Generating a Single Token
di: Gottesman, Daniela, et al.
Pubblicazione: (2024)
di: Gottesman, Daniela, et al.
Pubblicazione: (2024)
On the Limits of Token Reduction for Efficient Unified Vision Language Training
di: Chen, Siyi, et al.
Pubblicazione: (2026)
di: Chen, Siyi, et al.
Pubblicazione: (2026)
InstInfer: In-Storage Attention Offloading for Cost-Effective Long-Context LLM Inference
di: Pan, Xiurui, et al.
Pubblicazione: (2024)
di: Pan, Xiurui, et al.
Pubblicazione: (2024)
Psychological Assessments with Large Language Models: A Privacy-Focused and Cost-Effective Approach
di: Blanco-Cuaresma, Sergi
Pubblicazione: (2024)
di: Blanco-Cuaresma, Sergi
Pubblicazione: (2024)
Thunder-Tok: Minimizing Tokens per Word in Tokenizing Korean Texts for Generative Language Models
di: Cho, Gyeongje, et al.
Pubblicazione: (2025)
di: Cho, Gyeongje, et al.
Pubblicazione: (2025)
Steering Language Models in Multi-Token Generation: A Case Study on Tense and Aspect
di: Klerings, Alina, et al.
Pubblicazione: (2025)
di: Klerings, Alina, et al.
Pubblicazione: (2025)
Counterfactual Token Generation in Large Language Models
di: Chatzi, Ivi, et al.
Pubblicazione: (2024)
di: Chatzi, Ivi, et al.
Pubblicazione: (2024)
Documenti analoghi
-
On the Temporal Question-Answering Capabilities of Large Language Models Over Anonymized Data
di: Ruiz, Alfredo Garrachón, et al.
Pubblicazione: (2025) -
Methods for Matching English Language Addresses
di: Ramani, Keshav, et al.
Pubblicazione: (2024) -
Thinking Tokens for Language Modeling
di: Herel, David, et al.
Pubblicazione: (2024) -
TRIM: Token-wise Attention-Derived Saliency for Data-Efficient Instruction Tuning
di: Nagaraj, Manish, et al.
Pubblicazione: (2025) -
Effective Large Language Model Adaptation for Improved Grounding and Citation Generation
di: Ye, Xi, et al.
Pubblicazione: (2023)