Little Giants: Synthesizing High-Quality Embedding Data at Scale
Fuente:
arXiv
Saved in:
| Main Authors: | Chen, Haonan, Wang, Liang, Yang, Nan, Zhu, Yutao, Zhao, Ziliang, Wei, Furu, Dou, Zhicheng |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Chain-of-Retrieval Augmented Generation
by: Wang, Liang, et al.
Published: (2025)
by: Wang, Liang, et al.
Published: (2025)
ProRAG: Process-Supervised Reinforcement Learning for Retrieval-Augmented Generation
by: Wang, Zhao, et al.
Published: (2026)
by: Wang, Zhao, et al.
Published: (2026)
Query-oriented Data Augmentation for Session Search
by: Chen, Haonan, et al.
Published: (2024)
by: Chen, Haonan, et al.
Published: (2024)
Generalizing Conversational Dense Retrieval via LLM-Cognition Data Augmentation
by: Chen, Haonan, et al.
Published: (2024)
by: Chen, Haonan, et al.
Published: (2024)
mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data
by: Chen, Haonan, et al.
Published: (2025)
by: Chen, Haonan, et al.
Published: (2025)
Sliding Windows Are Not the End: Exploring Full Ranking with Long-Context Large Language Models
by: Liu, Wenhan, et al.
Published: (2024)
by: Liu, Wenhan, et al.
Published: (2024)
DemoRank: Selecting Effective Demonstrations for Large Language Models in Ranking Task
by: Liu, Wenhan, et al.
Published: (2024)
by: Liu, Wenhan, et al.
Published: (2024)
A Survey of Conversational Search
by: Mo, Fengran, et al.
Published: (2024)
by: Mo, Fengran, et al.
Published: (2024)
HiRA: A Hierarchical Reasoning Framework for Decoupled Planning and Execution in Deep Search
by: Jin, Jiajie, et al.
Published: (2025)
by: Jin, Jiajie, et al.
Published: (2025)
Improving Text Embeddings with Large Language Models
by: Wang, Liang, et al.
Published: (2023)
by: Wang, Liang, et al.
Published: (2023)
Learning to Retrieve In-Context Examples for Large Language Models
by: Wang, Liang, et al.
Published: (2023)
by: Wang, Liang, et al.
Published: (2023)
Multilingual E5 Text Embeddings: A Technical Report
by: Wang, Liang, et al.
Published: (2024)
by: Wang, Liang, et al.
Published: (2024)
From Matching to Generation: A Survey on Generative Information Retrieval
by: Li, Xiaoxi, et al.
Published: (2024)
by: Li, Xiaoxi, et al.
Published: (2024)
Search-o1: Agentic Search-Enhanced Large Reasoning Models
by: Li, Xiaoxi, et al.
Published: (2025)
by: Li, Xiaoxi, et al.
Published: (2025)
WebThinker: Empowering Large Reasoning Models with Deep Research Capability
by: Li, Xiaoxi, et al.
Published: (2025)
by: Li, Xiaoxi, et al.
Published: (2025)
Text Embeddings by Weakly-Supervised Contrastive Pre-training
by: Wang, Liang, et al.
Published: (2022)
by: Wang, Liang, et al.
Published: (2022)
Toward General Instruction-Following Alignment for Retrieval-Augmented Generation
by: Dong, Guanting, et al.
Published: (2024)
by: Dong, Guanting, et al.
Published: (2024)
ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability
by: Liu, Wenhan, et al.
Published: (2025)
by: Liu, Wenhan, et al.
Published: (2025)
AssistRAG: Boosting the Potential of Large Language Models with an Intelligent Information Assistant
by: Zhou, Yujia, et al.
Published: (2024)
by: Zhou, Yujia, et al.
Published: (2024)
Robustness Risk of Conversational Retrieval: Identifying and Mitigating Noise Sensitivity in Qwen3-Embedding Model
by: Chen, Weishu, et al.
Published: (2026)
by: Chen, Weishu, et al.
Published: (2026)
Large Language Models for Information Retrieval: A Survey
by: Zhu, Yutao, et al.
Published: (2023)
by: Zhu, Yutao, et al.
Published: (2023)
Bootstrap Your Own Context Length
by: Wang, Liang, et al.
Published: (2024)
by: Wang, Liang, et al.
Published: (2024)
Session-level Normalization and Click-through Data Enhancement for Session-based Evaluation
by: Chen, Haonan, et al.
Published: (2024)
by: Chen, Haonan, et al.
Published: (2024)
GISA: A Benchmark for General Information-Seeking Assistant
by: Zhu, Yutao, et al.
Published: (2026)
by: Zhu, Yutao, et al.
Published: (2026)
Semi-Parametric Retrieval via Binary Bag-of-Tokens Index
by: Zhou, Jiawei, et al.
Published: (2024)
by: Zhou, Jiawei, et al.
Published: (2024)
Progressive Multimodal Reasoning via Active Retrieval
by: Dong, Guanting, et al.
Published: (2024)
by: Dong, Guanting, et al.
Published: (2024)
Large Search Model: Redefining Search Stack in the Era of LLMs
by: Wang, Liang, et al.
Published: (2023)
by: Wang, Liang, et al.
Published: (2023)
CoRanking: Collaborative Ranking with Small and Large Ranking Agents
by: Liu, Wenhan, et al.
Published: (2025)
by: Liu, Wenhan, et al.
Published: (2025)
LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval
by: Jin, Jiajie, et al.
Published: (2026)
by: Jin, Jiajie, et al.
Published: (2026)
Agentic-R: Learning to Retrieve for Agentic Search
by: Liu, Wenhan, et al.
Published: (2026)
by: Liu, Wenhan, et al.
Published: (2026)
FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research
by: Jin, Jiajie, et al.
Published: (2024)
by: Jin, Jiajie, et al.
Published: (2024)
R$^3$AG: Retriever Routing for Retrieval-Augmented Generation
by: Zhao, Tong, et al.
Published: (2026)
by: Zhao, Tong, et al.
Published: (2026)
Boosting Long-Context Management via Query-Guided Activation Refilling
by: Qian, Hongjin, et al.
Published: (2024)
by: Qian, Hongjin, et al.
Published: (2024)
Grounding Language Model with Chunking-Free In-Context Retrieval
by: Qian, Hongjin, et al.
Published: (2024)
by: Qian, Hongjin, et al.
Published: (2024)
INTERS: Unlocking the Power of Large Language Models in Search with Instruction Tuning
by: Zhu, Yutao, et al.
Published: (2024)
by: Zhu, Yutao, et al.
Published: (2024)
Towards Mixed-Modal Retrieval for Universal Retrieval-Augmented Generation
by: Zhang, Chenghao, et al.
Published: (2025)
by: Zhang, Chenghao, et al.
Published: (2025)
ChatRetriever: Adapting Large Language Models for Generalized and Robust Conversational Dense Retrieval
by: Mao, Kelong, et al.
Published: (2024)
by: Mao, Kelong, et al.
Published: (2024)
ScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific Research
by: Lin, Junyong, et al.
Published: (2025)
by: Lin, Junyong, et al.
Published: (2025)
HawkBench: Investigating Resilience of RAG Methods on Stratified Information-Seeking Tasks
by: Qian, Hongjin, et al.
Published: (2025)
by: Qian, Hongjin, et al.
Published: (2025)
CORAL: Benchmarking Multi-turn Conversational Retrieval-Augmentation Generation
by: Cheng, Yiruo, et al.
Published: (2024)
by: Cheng, Yiruo, et al.
Published: (2024)
Similar Items
-
Chain-of-Retrieval Augmented Generation
by: Wang, Liang, et al.
Published: (2025) -
ProRAG: Process-Supervised Reinforcement Learning for Retrieval-Augmented Generation
by: Wang, Zhao, et al.
Published: (2026) -
Query-oriented Data Augmentation for Session Search
by: Chen, Haonan, et al.
Published: (2024) -
Generalizing Conversational Dense Retrieval via LLM-Cognition Data Augmentation
by: Chen, Haonan, et al.
Published: (2024) -
mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data
by: Chen, Haonan, et al.
Published: (2025)