LangProBe: a Language Programs Benchmark
Fuente:
arXiv
Guardado en:
| Autores principales: | Tan, Shangyin, Agrawal, Lakshya A, Singhvi, Arnav, Lai, Liheng, Ryan, Michael J, Klein, Dan, Khattab, Omar, Sen, Koushik, Zaharia, Matei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DSPy Assertions: Computational Constraints for Self-Refining Language Model Pipelines
por: Singhvi, Arnav, et al.
Publicado: (2023)
por: Singhvi, Arnav, et al.
Publicado: (2023)
WARP: An Efficient Engine for Multi-Vector Retrieval
por: Scheerer, Jan Luca, et al.
Publicado: (2025)
por: Scheerer, Jan Luca, et al.
Publicado: (2025)
ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems
por: Saad-Falcon, Jon, et al.
Publicado: (2023)
por: Saad-Falcon, Jon, et al.
Publicado: (2023)
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
por: Opsahl-Ong, Krista, et al.
Publicado: (2026)
por: Opsahl-Ong, Krista, et al.
Publicado: (2026)
Drowning in Documents: Consequences of Scaling Reranker Inference
por: Jacob, Mathew, et al.
Publicado: (2024)
por: Jacob, Mathew, et al.
Publicado: (2024)
ColBERT-serve: Efficient Multi-Stage Memory-Mapped Scoring
por: Huang, Kaili, et al.
Publicado: (2025)
por: Huang, Kaili, et al.
Publicado: (2025)
ACORN: Performant and Predicate-Agnostic Search Over Vector Embeddings and Structured Data
por: Patel, Liana, et al.
Publicado: (2024)
por: Patel, Liana, et al.
Publicado: (2024)
Can QPP Choose the Right Query Variant? Evaluating Query Variant Selection for RAG Pipelines
por: Arabzadeh, Negar, et al.
Publicado: (2026)
por: Arabzadeh, Negar, et al.
Publicado: (2026)
Image and Data Mining in Reticular Chemistry Using GPT-4V
por: Zheng, Zhiling, et al.
Publicado: (2023)
por: Zheng, Zhiling, et al.
Publicado: (2023)
RAG over Thinking Traces Can Improve Reasoning Tasks
por: Arabzadeh, Negar, et al.
Publicado: (2026)
por: Arabzadeh, Negar, et al.
Publicado: (2026)
OBLIQ-Bench: Exposing Overlooked Bottlenecks in Modern Retrievers with Latent and Implicit Queries
por: Tchuindjo, Diane, et al.
Publicado: (2026)
por: Tchuindjo, Diane, et al.
Publicado: (2026)
GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning
por: Agrawal, Lakshya A, et al.
Publicado: (2025)
por: Agrawal, Lakshya A, et al.
Publicado: (2025)
Why Large Language Models can Secretly Outperform Embedding Similarity in Information Retrieval
por: Benescu, Matei, et al.
Publicado: (2026)
por: Benescu, Matei, et al.
Publicado: (2026)
ProCIS: A Benchmark for Proactive Retrieval in Conversations
por: Samarinas, Chris, et al.
Publicado: (2024)
por: Samarinas, Chris, et al.
Publicado: (2024)
FreshStack: Building Realistic Benchmarks for Evaluating Retrieval on Technical Documents
por: Thakur, Nandan, et al.
Publicado: (2025)
por: Thakur, Nandan, et al.
Publicado: (2025)
FUTURAL: A Metasearch Platform for Empowering Rural Areas with Smart Solutions
por: Popovici, Matei, et al.
Publicado: (2026)
por: Popovici, Matei, et al.
Publicado: (2026)
Composing Policy Gradients and Prompt Optimization for Language Model Programs
por: Ziems, Noah, et al.
Publicado: (2025)
por: Ziems, Noah, et al.
Publicado: (2025)
Backtracing: Retrieving the Cause of the Query
por: Wang, Rose E., et al.
Publicado: (2024)
por: Wang, Rose E., et al.
Publicado: (2024)
DS SERVE: A Framework for Efficient and Scalable Neural Retrieval
por: Liu, Jinjian, et al.
Publicado: (2025)
por: Liu, Jinjian, et al.
Publicado: (2025)
LIR: The First Workshop on Late Interaction and Multi Vector Retrieval @ ECIR 2026
por: Clavié, Benjamin, et al.
Publicado: (2025)
por: Clavié, Benjamin, et al.
Publicado: (2025)
ProEx: A Unified Framework Leveraging Large Language Model with Profile Extrapolation for Recommendation
por: Zhang, Yi, et al.
Publicado: (2025)
por: Zhang, Yi, et al.
Publicado: (2025)
optimize_anything: A Universal API for Optimizing any Text Parameter
por: Agrawal, Lakshya A, et al.
Publicado: (2026)
por: Agrawal, Lakshya A, et al.
Publicado: (2026)
Knowledge Graph RAG: Agentic Crawling and Graph Construction in Enterprise Documents
por: Chakraborty, Koushik, et al.
Publicado: (2026)
por: Chakraborty, Koushik, et al.
Publicado: (2026)
HORIZON: A Benchmark for In-the-wild User Behaviour Modeling
por: Goel, Arnav, et al.
Publicado: (2026)
por: Goel, Arnav, et al.
Publicado: (2026)
CLARINET: Augmenting Language Models to Ask Clarification Questions for Retrieval
por: Chi, Yizhou, et al.
Publicado: (2024)
por: Chi, Yizhou, et al.
Publicado: (2024)
Improving Few-Shot Cross-Domain Named Entity Recognition by Instruction Tuning a Word-Embedding based Retrieval Augmented Large Language Model
por: Nandi, Subhadip, et al.
Publicado: (2024)
por: Nandi, Subhadip, et al.
Publicado: (2024)
Better Late Than Never: Formulating and Benchmarking Recommendation Editing
por: Lai, Chengyu, et al.
Publicado: (2024)
por: Lai, Chengyu, et al.
Publicado: (2024)
Evaluating Recabilities of Foundation Models: A Multi-Domain, Multi-Dataset Benchmark
por: Liu, Qijiong, et al.
Publicado: (2025)
por: Liu, Qijiong, et al.
Publicado: (2025)
Hindi-BEIR : A Large Scale Retrieval Benchmark in Hindi
por: Acharya, Arkadeep, et al.
Publicado: (2024)
por: Acharya, Arkadeep, et al.
Publicado: (2024)
Retrieval-in-the-Chain: Bootstrapping Large Language Models for Generative Retrieval
por: Zhang, Yingchen, et al.
Publicado: (2025)
por: Zhang, Yingchen, et al.
Publicado: (2025)
Bridging Language and Items for Retrieval and Recommendation: Benchmarking LLMs as Semantic Encoders
por: Hou, Yupeng, et al.
Publicado: (2024)
por: Hou, Yupeng, et al.
Publicado: (2024)
LUSIFER: Language Universal Space Integration for Enhanced Multilingual Embeddings with Large Language Models
por: Man, Hieu, et al.
Publicado: (2025)
por: Man, Hieu, et al.
Publicado: (2025)
ProMax: Exploring the Potential of LLM-derived Profiles with Distribution Shaping for Recommender Systems
por: Zhang, Yi, et al.
Publicado: (2026)
por: Zhang, Yi, et al.
Publicado: (2026)
ProRank: Prompt Warmup via Reinforcement Learning for Small Language Models Reranking
por: Li, Xianming, et al.
Publicado: (2025)
por: Li, Xianming, et al.
Publicado: (2025)
AIANO: Enhancing Information Retrieval with AI-Augmented Annotation
por: Khattab, Sameh, et al.
Publicado: (2026)
por: Khattab, Sameh, et al.
Publicado: (2026)
Mindful-RAG: A Study of Points of Failure in Retrieval Augmented Generation
por: Agrawal, Garima, et al.
Publicado: (2024)
por: Agrawal, Garima, et al.
Publicado: (2024)
A Counterfactual Explanation Framework for Retrieval Models
por: Chandna, Bhavik, et al.
Publicado: (2024)
por: Chandna, Bhavik, et al.
Publicado: (2024)
The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability
por: Hu, Guangneng
Publicado: (2025)
por: Hu, Guangneng
Publicado: (2025)
Benchmarking and Building Zero-Shot Hindi Retrieval Model with Hindi-BEIR and NLLB-E5
por: Acharya, Arkadeep, et al.
Publicado: (2024)
por: Acharya, Arkadeep, et al.
Publicado: (2024)
DataPro -- A Standardized Data Understanding and Processing Procedure: A Case Study of an Eco-Driving Project
por: Ma, Zhipeng, et al.
Publicado: (2025)
por: Ma, Zhipeng, et al.
Publicado: (2025)
Ejemplares similares
-
DSPy Assertions: Computational Constraints for Self-Refining Language Model Pipelines
por: Singhvi, Arnav, et al.
Publicado: (2023) -
WARP: An Efficient Engine for Multi-Vector Retrieval
por: Scheerer, Jan Luca, et al.
Publicado: (2025) -
ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems
por: Saad-Falcon, Jon, et al.
Publicado: (2023) -
OfficeQA Pro: An Enterprise Benchmark for End-to-End Grounded Reasoning
por: Opsahl-Ong, Krista, et al.
Publicado: (2026) -
Drowning in Documents: Consequences of Scaling Reranker Inference
por: Jacob, Mathew, et al.
Publicado: (2024)