Tevatron 2.0: Unified Document Retrieval Toolkit across Scale, Language, and Modality
Fuente:
arXiv
Saved in:
| Main Authors: | Ma, Xueguang, Gao, Luyu, Zhuang, Shengyao, Zhan, Jiaqi Samantha, Callan, Jamie, Lin, Jimmy |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
MAGMaR Shared Task System Description: Video Retrieval with OmniEmbed
by: Zhan, Jiaqi Samantha, et al.
Published: (2025)
by: Zhan, Jiaqi Samantha, et al.
Published: (2025)
PromptReps: Prompting Large Language Models to Generate Dense and Sparse Representations for Zero-Shot Document Retrieval
by: Zhuang, Shengyao, et al.
Published: (2024)
by: Zhuang, Shengyao, et al.
Published: (2024)
Document Screenshot Retrievers are Vulnerable to Pixel Poisoning Attacks
by: Zhuang, Shengyao, et al.
Published: (2025)
by: Zhuang, Shengyao, et al.
Published: (2025)
Repository-level Code Search with Neural Retrieval Methods
by: Gandhi, Siddharth, et al.
Published: (2025)
by: Gandhi, Siddharth, et al.
Published: (2025)
ACER: Automatic Language Model Context Extension via Retrieval
by: Gao, Luyu, et al.
Published: (2024)
by: Gao, Luyu, et al.
Published: (2024)
Rank-R1: Enhancing Reasoning in LLM-based Document Rerankers via Reinforcement Learning
by: Zhuang, Shengyao, et al.
Published: (2025)
by: Zhuang, Shengyao, et al.
Published: (2025)
VISA: Retrieval Augmented Generation with Visual Source Attribution
by: Ma, Xueguang, et al.
Published: (2024)
by: Ma, Xueguang, et al.
Published: (2024)
Unifying Multimodal Retrieval via Document Screenshot Embedding
by: Ma, Xueguang, et al.
Published: (2024)
by: Ma, Xueguang, et al.
Published: (2024)
LACONIC: Dense-Level Effectiveness for Scalable Sparse Retrieval via a Two-Phase Training Curriculum
by: Xu, Zhichao, et al.
Published: (2026)
by: Xu, Zhichao, et al.
Published: (2026)
Hard Negatives, Hard Lessons: Revisiting Training Data Quality for Robust Information Retrieval with LLMs
by: Thakur, Nandan, et al.
Published: (2025)
by: Thakur, Nandan, et al.
Published: (2025)
Dwell in the Beginning: How Language Models Embed Long Documents for Dense Retrieval
by: Coelho, João, et al.
Published: (2024)
by: Coelho, João, et al.
Published: (2024)
Building Retrieval Systems for the ClueWeb22-B Corpus
by: Mehrotra, Harshit, et al.
Published: (2024)
by: Mehrotra, Harshit, et al.
Published: (2024)
DRAMA: Diverse Augmentation from Large Language Models to Smaller Dense Retrievers
by: Ma, Xueguang, et al.
Published: (2025)
by: Ma, Xueguang, et al.
Published: (2025)
Team IELAB at TREC Clinical Trial Track 2023: Enhancing Clinical Trial Retrieval with Neural Rankers and Large Language Models
by: Zhuang, Shengyao, et al.
Published: (2024)
by: Zhuang, Shengyao, et al.
Published: (2024)
Layer-wise Token Compression for Efficient Document Reranking
by: Zhuang, Shengyao, et al.
Published: (2026)
by: Zhuang, Shengyao, et al.
Published: (2026)
Leveraging LLMs for Unsupervised Dense Retriever Ranking
by: Khramtsova, Ekaterina, et al.
Published: (2024)
by: Khramtsova, Ekaterina, et al.
Published: (2024)
ORBIT: Scalable and Verifiable Data Generation for Search Agents on a Tight Budget
by: Thakur, Nandan, et al.
Published: (2026)
by: Thakur, Nandan, et al.
Published: (2026)
Leveraging Reference Documents for Zero-Shot Ranking via Large Language Models
by: Li, Jieran, et al.
Published: (2025)
by: Li, Jieran, et al.
Published: (2025)
Dense Retrieval with Continuous Explicit Feedback for Systematic Review Screening Prioritisation
by: Mao, Xinyu, et al.
Published: (2024)
by: Mao, Xinyu, et al.
Published: (2024)
Rethinking On-policy Optimization for Query Augmentation
by: Xu, Zhichao, et al.
Published: (2025)
by: Xu, Zhichao, et al.
Published: (2025)
2D Matryoshka Training for Information Retrieval
by: Wang, Shuai, et al.
Published: (2024)
by: Wang, Shuai, et al.
Published: (2024)
Large Language Models for Stemming: Promises, Pitfalls and Failures
by: Wang, Shuai, et al.
Published: (2024)
by: Wang, Shuai, et al.
Published: (2024)
Understanding and Mitigating the Threat of Vec2Text to Dense Retrieval Systems
by: Zhuang, Shengyao, et al.
Published: (2024)
by: Zhuang, Shengyao, et al.
Published: (2024)
FeB4RAG: Evaluating Federated Search in the Context of Retrieval Augmented Generation
by: Wang, Shuai, et al.
Published: (2024)
by: Wang, Shuai, et al.
Published: (2024)
A Setwise Approach for Effective and Highly Efficient Zero-shot Ranking with Large Language Models
by: Zhuang, Shengyao, et al.
Published: (2023)
by: Zhuang, Shengyao, et al.
Published: (2023)
Embark on DenseQuest: A System for Selecting the Best Dense Retriever for a Custom Collection
by: Khramtsova, Ekaterina, et al.
Published: (2024)
by: Khramtsova, Ekaterina, et al.
Published: (2024)
Operational Advice for Dense and Sparse Retrievers: HNSW, Flat, or Inverted Indexes?
by: Lin, Jimmy
Published: (2024)
by: Lin, Jimmy
Published: (2024)
BrowseComp-Plus: A More Fair and Transparent Evaluation Benchmark of Deep-Research Agent
by: Chen, Zijian, et al.
Published: (2025)
by: Chen, Zijian, et al.
Published: (2025)
Does Vec2Text Pose a New Corpus Poisoning Threat?
by: Zhuang, Shengyao, et al.
Published: (2024)
by: Zhuang, Shengyao, et al.
Published: (2024)
UniFAR: A Unified Facet-Aware Retrieval Framework for Scientific Documents
by: Dou, Zheng, et al.
Published: (2026)
by: Dou, Zheng, et al.
Published: (2026)
ReSLLM: Large Language Models are Strong Resource Selectors for Federated Search
by: Wang, Shuai, et al.
Published: (2024)
by: Wang, Shuai, et al.
Published: (2024)
LLM-VPRF: Large Language Model Based Vector Pseudo Relevance Feedback
by: Li, Hang, et al.
Published: (2025)
by: Li, Hang, et al.
Published: (2025)
Less LLM, More Documents: Searching for Improved RAG
by: Ning, Jingjie, et al.
Published: (2025)
by: Ning, Jingjie, et al.
Published: (2025)
Towards Cross-Modal Text-Molecule Retrieval with Better Modality Alignment
by: Song, Jia, et al.
Published: (2024)
by: Song, Jia, et al.
Published: (2024)
UniRAG: Universal Retrieval Augmentation for Large Vision Language Models
by: Sharifymoghaddam, Sahel, et al.
Published: (2024)
by: Sharifymoghaddam, Sahel, et al.
Published: (2024)
AgentIR: Reasoning-Aware Retrieval for Deep Research Agents
by: Chen, Zijian, et al.
Published: (2026)
by: Chen, Zijian, et al.
Published: (2026)
Illusions of Relevance: Arbitrary Content Injection Attacks Deceive Retrievers, Rerankers, and LLM Judges
by: Tamber, Manveer Singh, et al.
Published: (2025)
by: Tamber, Manveer Singh, et al.
Published: (2025)
Starbucks-v2: Improved Training for 2D Matryoshka Embeddings
by: Zhuang, Shengyao, et al.
Published: (2024)
by: Zhuang, Shengyao, et al.
Published: (2024)
An Investigation of Prompt Variations for Zero-shot LLM-based Rankers
by: Sun, Shuoqi, et al.
Published: (2024)
by: Sun, Shuoqi, et al.
Published: (2024)
Distillation versus Contrastive Learning: How to Train Your Rerankers
by: Xu, Zhichao, et al.
Published: (2025)
by: Xu, Zhichao, et al.
Published: (2025)
Similar Items
-
MAGMaR Shared Task System Description: Video Retrieval with OmniEmbed
by: Zhan, Jiaqi Samantha, et al.
Published: (2025) -
PromptReps: Prompting Large Language Models to Generate Dense and Sparse Representations for Zero-Shot Document Retrieval
by: Zhuang, Shengyao, et al.
Published: (2024) -
Document Screenshot Retrievers are Vulnerable to Pixel Poisoning Attacks
by: Zhuang, Shengyao, et al.
Published: (2025) -
Repository-level Code Search with Neural Retrieval Methods
by: Gandhi, Siddharth, et al.
Published: (2025) -
ACER: Automatic Language Model Context Extension via Retrieval
by: Gao, Luyu, et al.
Published: (2024)