Small Models, Big Insights: Leveraging Slim Proxy Models To Decide When and What to Retrieve for LLMs
Fuente:
arXiv
Salvato in:
| Autori principali: | Tan, Jiejun, Dou, Zhicheng, Zhu, Yutao, Guo, Peidong, Fang, Kun, Wen, Ji-Rong |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
MemSifter: Offloading LLM Memory Retrieval via Outcome-Driven Proxy Reasoning
di: Tan, Jiejun, et al.
Pubblicazione: (2026)
di: Tan, Jiejun, et al.
Pubblicazione: (2026)
HtmlRAG: HTML is Better Than Plain Text for Modeling Retrieved Knowledge in RAG Systems
di: Tan, Jiejun, et al.
Pubblicazione: (2024)
di: Tan, Jiejun, et al.
Pubblicazione: (2024)
One Token Can Help! Learning Scalable and Pluggable Virtual Tokens for Retrieval-Augmented Large Language Models
di: Zhu, Yutao, et al.
Pubblicazione: (2024)
di: Zhu, Yutao, et al.
Pubblicazione: (2024)
OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain
di: Wang, Shuting, et al.
Pubblicazione: (2024)
di: Wang, Shuting, et al.
Pubblicazione: (2024)
Understand What LLM Needs: Dual Preference Alignment for Retrieval-Augmented Generation
di: Dong, Guanting, et al.
Pubblicazione: (2024)
di: Dong, Guanting, et al.
Pubblicazione: (2024)
Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and Reasoning
di: Hu, Yuyang, et al.
Pubblicazione: (2026)
di: Hu, Yuyang, et al.
Pubblicazione: (2026)
DomainRAG: A Chinese Benchmark for Evaluating Domain-specific Retrieval-Augmented Generation
di: Wang, Shuting, et al.
Pubblicazione: (2024)
di: Wang, Shuting, et al.
Pubblicazione: (2024)
Progressive Multimodal Reasoning via Active Retrieval
di: Dong, Guanting, et al.
Pubblicazione: (2024)
di: Dong, Guanting, et al.
Pubblicazione: (2024)
Query-oriented Data Augmentation for Session Search
di: Chen, Haonan, et al.
Pubblicazione: (2024)
di: Chen, Haonan, et al.
Pubblicazione: (2024)
Toward General Instruction-Following Alignment for Retrieval-Augmented Generation
di: Dong, Guanting, et al.
Pubblicazione: (2024)
di: Dong, Guanting, et al.
Pubblicazione: (2024)
UFO: a Unified and Flexible Framework for Evaluating Factuality of Large Language Models
di: Huang, Zhaoheng, et al.
Pubblicazione: (2024)
di: Huang, Zhaoheng, et al.
Pubblicazione: (2024)
ChatShopBuddy: Towards Reliable Conversational Shopping Agents via Reinforcement Learning
di: Cheng, Yiruo, et al.
Pubblicazione: (2026)
di: Cheng, Yiruo, et al.
Pubblicazione: (2026)
BIDER: Bridging Knowledge Inconsistency for Efficient Retrieval-Augmented LLMs via Key Supporting Evidence
di: Jin, Jiajie, et al.
Pubblicazione: (2024)
di: Jin, Jiajie, et al.
Pubblicazione: (2024)
Single LLM, Multiple Roles: A Unified Retrieval-Augmented Generation Framework Using Role-Specific Token Optimization
di: Zhu, Yutao, et al.
Pubblicazione: (2025)
di: Zhu, Yutao, et al.
Pubblicazione: (2025)
R$^3$AG: Retriever Routing for Retrieval-Augmented Generation
di: Zhao, Tong, et al.
Pubblicazione: (2026)
di: Zhao, Tong, et al.
Pubblicazione: (2026)
DemoRank: Selecting Effective Demonstrations for Large Language Models in Ranking Task
di: Liu, Wenhan, et al.
Pubblicazione: (2024)
di: Liu, Wenhan, et al.
Pubblicazione: (2024)
Large Language Models for Information Retrieval: A Survey
di: Zhu, Yutao, et al.
Pubblicazione: (2023)
di: Zhu, Yutao, et al.
Pubblicazione: (2023)
HierSearch: A Hierarchical Enterprise Deep Search Framework Integrating Local and Web Searches
di: Tan, Jiejun, et al.
Pubblicazione: (2025)
di: Tan, Jiejun, et al.
Pubblicazione: (2025)
ATIR: Towards Audio-Text Interleaved Contextual Retrieval
di: Zhao, Tong, et al.
Pubblicazione: (2026)
di: Zhao, Tong, et al.
Pubblicazione: (2026)
EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis
di: Song, Xiaoshuai, et al.
Pubblicazione: (2026)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2026)
WebThinker: Empowering Large Reasoning Models with Deep Research Capability
di: Li, Xiaoxi, et al.
Pubblicazione: (2025)
di: Li, Xiaoxi, et al.
Pubblicazione: (2025)
INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning
di: Zhu, Yutao, et al.
Pubblicazione: (2024)
di: Zhu, Yutao, et al.
Pubblicazione: (2024)
From Novice to Expert: LLM Agent Policy Optimization via Step-wise Reinforcement Learning
di: Deng, Zhirui, et al.
Pubblicazione: (2024)
di: Deng, Zhirui, et al.
Pubblicazione: (2024)
FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research
di: Jin, Jiajie, et al.
Pubblicazione: (2024)
di: Jin, Jiajie, et al.
Pubblicazione: (2024)
DailyQA: A Benchmark to Evaluate Web Retrieval Augmented LLMs Based on Capturing Real-World Changes
di: Cheng, Jiehan, et al.
Pubblicazione: (2025)
di: Cheng, Jiehan, et al.
Pubblicazione: (2025)
Can Confidence Estimates Decide When Chain-of-Thought Is Necessary for LLMs?
di: Lewis-Lim, Samuel, et al.
Pubblicazione: (2025)
di: Lewis-Lim, Samuel, et al.
Pubblicazione: (2025)
RichRAG: Crafting Rich Responses for Multi-faceted Queries in Retrieval-Augmented Generation
di: Wang, Shuting, et al.
Pubblicazione: (2024)
di: Wang, Shuting, et al.
Pubblicazione: (2024)
Revisiting RAG Ensemble: A Theoretical and Mechanistic Analysis of Multi-RAG System Collaboration
di: Chen, Yifei, et al.
Pubblicazione: (2025)
di: Chen, Yifei, et al.
Pubblicazione: (2025)
Agentic-R: Learning to Retrieve for Agentic Search
di: Liu, Wenhan, et al.
Pubblicazione: (2026)
di: Liu, Wenhan, et al.
Pubblicazione: (2026)
CoRanking: Collaborative Ranking with Small and Large Ranking Agents
di: Liu, Wenhan, et al.
Pubblicazione: (2025)
di: Liu, Wenhan, et al.
Pubblicazione: (2025)
From Matching to Generation: A Survey on Generative Information Retrieval
di: Li, Xiaoxi, et al.
Pubblicazione: (2024)
di: Li, Xiaoxi, et al.
Pubblicazione: (2024)
LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval
di: Jin, Jiajie, et al.
Pubblicazione: (2026)
di: Jin, Jiajie, et al.
Pubblicazione: (2026)
SlimLM: An Efficient Small Language Model for On-Device Document Assistance
di: Pham, Thang M., et al.
Pubblicazione: (2024)
di: Pham, Thang M., et al.
Pubblicazione: (2024)
LLMs + Persona-Plug = Personalized LLMs
di: Liu, Jiongnan, et al.
Pubblicazione: (2024)
di: Liu, Jiongnan, et al.
Pubblicazione: (2024)
PD-Loss: Proxy-Decidability for Efficient Metric Learning
di: Silva, Pedro, et al.
Pubblicazione: (2025)
di: Silva, Pedro, et al.
Pubblicazione: (2025)
An Analysis on Matching Mechanisms and Token Pruning for Late-interaction Models
di: Liu, Qi, et al.
Pubblicazione: (2024)
di: Liu, Qi, et al.
Pubblicazione: (2024)
Big Reasoning with Small Models: Instruction Retrieval at Inference Time
di: Alkiek, Kenan, et al.
Pubblicazione: (2025)
di: Alkiek, Kenan, et al.
Pubblicazione: (2025)
Memory-enhanced Retrieval Augmentation for Long Video Understanding
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
di: Yuan, Huaying, et al.
Pubblicazione: (2025)
Majority Kernels: An Approach to Leverage Big Model Dynamics for Efficient Small Model Training
di: Mazzawi, Hanna, et al.
Pubblicazione: (2024)
di: Mazzawi, Hanna, et al.
Pubblicazione: (2024)
A Multi-Task Embedder For Retrieval Augmented LLMs
di: Zhang, Peitian, et al.
Pubblicazione: (2023)
di: Zhang, Peitian, et al.
Pubblicazione: (2023)
Documenti analoghi
-
MemSifter: Offloading LLM Memory Retrieval via Outcome-Driven Proxy Reasoning
di: Tan, Jiejun, et al.
Pubblicazione: (2026) -
HtmlRAG: HTML is Better Than Plain Text for Modeling Retrieved Knowledge in RAG Systems
di: Tan, Jiejun, et al.
Pubblicazione: (2024) -
One Token Can Help! Learning Scalable and Pluggable Virtual Tokens for Retrieval-Augmented Large Language Models
di: Zhu, Yutao, et al.
Pubblicazione: (2024) -
OmniEval: An Omnidirectional and Automatic RAG Evaluation Benchmark in Financial Domain
di: Wang, Shuting, et al.
Pubblicazione: (2024) -
Understand What LLM Needs: Dual Preference Alignment for Retrieval-Augmented Generation
di: Dong, Guanting, et al.
Pubblicazione: (2024)