Why Global LLM Leaderboards Are Misleading: Small Portfolios for Heterogeneous Supervised ML
Fuente:
arXiv
Saved in:
| Main Authors: | Moondra, Jai, Chughtai, Ayela, Lanka, Bhargavi, Gupta, Swati |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
TransResAI: A Compound AI System for Coastal Transportation Resilience
by: Pu, Qingwen, et al.
Published: (2026)
by: Pu, Qingwen, et al.
Published: (2026)
Persistent Identity in AI Agents: A Multi-Anchor Architecture for Resilient Memory and Continuity
by: Menon, Prahlad G.
Published: (2026)
by: Menon, Prahlad G.
Published: (2026)
LLM-as-a-Judge: Rapid Evaluation of Legal Document Recommendation for Retrieval-Augmented Generation
by: Pradhan, Anu, et al.
Published: (2025)
by: Pradhan, Anu, et al.
Published: (2025)
What Matters in LLM-Based Feature Extractor for Recommender? A Systematic Analysis of Prompts, Models, and Adaptation
by: Shi, Kainan, et al.
Published: (2025)
by: Shi, Kainan, et al.
Published: (2025)
MasterSet: A Large-Scale Benchmark for Must-Cite Citation Recommendation in the AI/ML Literature
by: Ratul, Md Toyaha Rahman, et al.
Published: (2026)
by: Ratul, Md Toyaha Rahman, et al.
Published: (2026)
Evolve: A Persistent Knowledge Lifecycle for Small Language Models
by: Hovagimian, Dikran
Published: (2026)
by: Hovagimian, Dikran
Published: (2026)
Criteria-Based LLM Relevance Judgments
by: Farzi, Naghmeh, et al.
Published: (2025)
by: Farzi, Naghmeh, et al.
Published: (2025)
ToolForge: A Data Synthesis Pipeline for Multi-Hop Search without Real-World APIs
by: Chen, Hao, et al.
Published: (2025)
by: Chen, Hao, et al.
Published: (2025)
LLM Reasoning for Cold-Start Item Recommendation
by: Li, Shijun, et al.
Published: (2025)
by: Li, Shijun, et al.
Published: (2025)
EdgeJury: Cross-Reviewed Small-Model Ensembles for Truthful Question Answering on Serverless Edge Inference
by: Kumar, Aayush
Published: (2025)
by: Kumar, Aayush
Published: (2025)
Understanding Multi-Agent LLM Frameworks: A Unified Benchmark and Experimental Analysis
by: Orogat, Abdelghny, et al.
Published: (2026)
by: Orogat, Abdelghny, et al.
Published: (2026)
NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data
by: Ming, Cong, et al.
Published: (2026)
by: Ming, Cong, et al.
Published: (2026)
Smart ETL and LLM-based contents classification: the European Smart Tourism Tools Observatory experience
by: Cosme, Diogo, et al.
Published: (2024)
by: Cosme, Diogo, et al.
Published: (2024)
The Case for Intent-Based Query Rewriting
by: Nicolai, Gianna Lisa, et al.
Published: (2025)
by: Nicolai, Gianna Lisa, et al.
Published: (2025)
EQUATOR: A Deterministic Framework for Evaluating LLM Reasoning with Open-Ended Questions. # v1.0.0-beta
by: Bernard, Raymond, et al.
Published: (2024)
by: Bernard, Raymond, et al.
Published: (2024)
PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering
by: Zhang, Yiqing, et al.
Published: (2026)
by: Zhang, Yiqing, et al.
Published: (2026)
ChronoMedKG: A Temporally-Grounded Biomedical Knowledge Graph and Benchmark for Clinical Reasoning
by: Ahmed, Md Shamim, et al.
Published: (2026)
by: Ahmed, Md Shamim, et al.
Published: (2026)
LLMLogAnalyzer: A Clustering-Based Log Analysis Chatbot using Large Language Models
by: Cai, Peng, et al.
Published: (2025)
by: Cai, Peng, et al.
Published: (2025)
Tokenization Disparities as Infrastructure Bias: How Subword Systems Create Inequities in LLM Access and Efficiency
by: Teklehaymanot, Hailay Kidu, et al.
Published: (2025)
by: Teklehaymanot, Hailay Kidu, et al.
Published: (2025)
Knowledge-Aware Iterative Retrieval for Multi-Agent Systems
by: Song, Seyoung
Published: (2025)
by: Song, Seyoung
Published: (2025)
MODP: Multi Objective Directional Prompting
by: Nema, Aashutosh, et al.
Published: (2025)
by: Nema, Aashutosh, et al.
Published: (2025)
A Grounded Memory System For Smart Personal Assistants
by: Ocker, Felix, et al.
Published: (2025)
by: Ocker, Felix, et al.
Published: (2025)
Real-World En Call Center Transcripts Dataset with PII Redaction
by: Dao, Ha, et al.
Published: (2025)
by: Dao, Ha, et al.
Published: (2025)
Semantic Reconstruction of Adversarial Plagiarism: A Context-Aware Framework for Detecting and Restoring "Tortured Phrases" in Scientific Literature
by: Maiti, Agniva, et al.
Published: (2025)
by: Maiti, Agniva, et al.
Published: (2025)
ArcheType: A Novel Framework for Open-Source Column Type Annotation using Large Language Models
by: Feuer, Benjamin, et al.
Published: (2023)
by: Feuer, Benjamin, et al.
Published: (2023)
Uncovering the Limitations of Query Performance Prediction: Failures, Insights, and Implications for Selective Query Processing
by: Chifu, Adrian-Gabriel, et al.
Published: (2025)
by: Chifu, Adrian-Gabriel, et al.
Published: (2025)
Flippi: End To End GenAI Assistant for E-Commerce
by: Rajasekar, Anand A., et al.
Published: (2025)
by: Rajasekar, Anand A., et al.
Published: (2025)
Fine-Grained Emotion Recognition via In-Context Learning
by: Ren, Zhaochun, et al.
Published: (2025)
by: Ren, Zhaochun, et al.
Published: (2025)
Adaptive ToR: Complexity-Aware Tree-Based Retrieval for Pareto-Optimal Multi-Intent NLU
by: Yoo, Hee-Kyong, et al.
Published: (2026)
by: Yoo, Hee-Kyong, et al.
Published: (2026)
NewsScope: Schema-Grounded Cross-Domain News Claim Extraction with Open Models
by: Pandya, Nidhi
Published: (2025)
by: Pandya, Nidhi
Published: (2025)
Evaluation of Chunking Strategies for Effective Text Embedding in Low-Resource Language on Agricultural Documents
by: Chhoun, Sovandara, et al.
Published: (2026)
by: Chhoun, Sovandara, et al.
Published: (2026)
Stage-Audit: Auditable Source-Frontier Discovery for Cross-Wiki Tables
by: Shen, Chen
Published: (2026)
by: Shen, Chen
Published: (2026)
BridgeRAG: Training-Free Bridge-Conditioned Retrieval for Multi-Hop Question Answering
by: Bacellar, Andre
Published: (2026)
by: Bacellar, Andre
Published: (2026)
Train Once, Use Flexibly: A Modular Framework for Multi-Aspect Neural News Recommendation
by: Iana, Andreea, et al.
Published: (2023)
by: Iana, Andreea, et al.
Published: (2023)
Towards Adaptive Context Management for Intelligent Conversational Question Answering
by: Perera, Manoj Madushanka, et al.
Published: (2025)
by: Perera, Manoj Madushanka, et al.
Published: (2025)
Session Context Embedding for Intent Understanding in Product Search
by: Mehrdad, Navid, et al.
Published: (2024)
by: Mehrdad, Navid, et al.
Published: (2024)
Scaling Multilingual Semantic Search in Uber Eats Delivery
by: Ling, Bo, et al.
Published: (2026)
by: Ling, Bo, et al.
Published: (2026)
When Stored Evidence Stops Being Usable: Scale-Conditioned Evaluation of Agent Memory
by: Shao, Jiaqi, et al.
Published: (2026)
by: Shao, Jiaqi, et al.
Published: (2026)
Does UMBRELA Work on Other LLMs?
by: Farzi, Naghmeh, et al.
Published: (2025)
by: Farzi, Naghmeh, et al.
Published: (2025)
Optimizing Retrieval-Augmented Generation for Electrical Engineering: A Case Study on ABB Circuit Breakers
by: Alawadhi, Salahuddin, et al.
Published: (2025)
by: Alawadhi, Salahuddin, et al.
Published: (2025)
Similar Items
-
TransResAI: A Compound AI System for Coastal Transportation Resilience
by: Pu, Qingwen, et al.
Published: (2026) -
Persistent Identity in AI Agents: A Multi-Anchor Architecture for Resilient Memory and Continuity
by: Menon, Prahlad G.
Published: (2026) -
LLM-as-a-Judge: Rapid Evaluation of Legal Document Recommendation for Retrieval-Augmented Generation
by: Pradhan, Anu, et al.
Published: (2025) -
What Matters in LLM-Based Feature Extractor for Recommender? A Systematic Analysis of Prompts, Models, and Adaptation
by: Shi, Kainan, et al.
Published: (2025) -
MasterSet: A Large-Scale Benchmark for Must-Cite Citation Recommendation in the AI/ML Literature
by: Ratul, Md Toyaha Rahman, et al.
Published: (2026)