ReFeR: Improving Evaluation and Reasoning through Hierarchy of Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Narsupalli, Yaswanth, Chandra, Abhranil, Muppirala, Sreevatsa, Gupta, Manish, Goyal, Pawan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs
par: Mishra, Sandeep, et autres
Publié: (2026)
par: Mishra, Sandeep, et autres
Publié: (2026)
DocQAC: Adaptive Trie-Guided Decoding for Effective In-Document Query Auto-Completion
par: Mehta, Rahul, et autres
Publié: (2026)
par: Mehta, Rahul, et autres
Publié: (2026)
Program of Thoughts for Financial Reasoning: Leveraging Dynamic In-Context Examples and Generative Retrieval
par: Khatuya, Subhendu, et autres
Publié: (2025)
par: Khatuya, Subhendu, et autres
Publié: (2025)
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
par: Dong, Yihong, et autres
Publié: (2026)
par: Dong, Yihong, et autres
Publié: (2026)
IL-TUR: Benchmark for Indian Legal Text Understanding and Reasoning
par: Joshi, Abhinav, et autres
Publié: (2024)
par: Joshi, Abhinav, et autres
Publié: (2024)
Applications of Large Language Model Reasoning in Feature Generation
par: Chandra, Dharani
Publié: (2025)
par: Chandra, Dharani
Publié: (2025)
IDALC: A Semi-Supervised Framework for Intent Detection and Active Learning based Correction
par: Mullick, Ankan, et autres
Publié: (2025)
par: Mullick, Ankan, et autres
Publié: (2025)
CHBench: A Cognitive Hierarchy Benchmark for Evaluating Strategic Reasoning Capability of LLMs
par: Liu, Hongtao, et autres
Publié: (2025)
par: Liu, Hongtao, et autres
Publié: (2025)
Evaluating Large Language Models Using Contrast Sets: An Experimental Approach
par: Sanwal, Manish
Publié: (2024)
par: Sanwal, Manish
Publié: (2024)
DPO Kernels: A Semantically-Aware, Kernel-Enhanced, and Divergence-Rich Paradigm for Direct Preference Optimization
par: Das, Amitava, et autres
Publié: (2025)
par: Das, Amitava, et autres
Publié: (2025)
No Universal Prompt: Unifying Reasoning through Adaptive Prompting for Temporal Table Reasoning
par: Rajgaria, Abhishek, et autres
Publié: (2025)
par: Rajgaria, Abhishek, et autres
Publié: (2025)
ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context
par: Kim, Joongwon, et autres
Publié: (2025)
par: Kim, Joongwon, et autres
Publié: (2025)
Improving LLM Reasoning through Interpretable Role-Playing Steering
par: Wang, Anyi, et autres
Publié: (2025)
par: Wang, Anyi, et autres
Publié: (2025)
CurLL: A Developmental Framework to Evaluate Continual Learning in Language Models
par: Kalyan, Pavan, et autres
Publié: (2025)
par: Kalyan, Pavan, et autres
Publié: (2025)
P-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains
par: Han, Simeng, et autres
Publié: (2024)
par: Han, Simeng, et autres
Publié: (2024)
ReAttn: Improving Attention-based Re-ranking via Attention Re-weighting
par: Tian, Yuxing, et autres
Publié: (2026)
par: Tian, Yuxing, et autres
Publié: (2026)
Prompt Attacks Reveal Superficial Knowledge Removal in Unlearning Methods
par: Jang, Yeonwoo, et autres
Publié: (2025)
par: Jang, Yeonwoo, et autres
Publié: (2025)
Label-semantics Aware Generative Approach for Domain-Agnostic Multilabel Classification
par: Khatuya, Subhendu, et autres
Publié: (2025)
par: Khatuya, Subhendu, et autres
Publié: (2025)
Improving Arithmetic Reasoning Ability of Large Language Models through Relation Tuples, Verification and Dynamic Feedback
par: Miao, Zhongtao, et autres
Publié: (2024)
par: Miao, Zhongtao, et autres
Publié: (2024)
SERPENT-VLM : Self-Refining Radiology Report Generation Using Vision Language Models
par: Kapadnis, Manav Nitin, et autres
Publié: (2024)
par: Kapadnis, Manav Nitin, et autres
Publié: (2024)
Improve Rule Retrieval and Reasoning with Self-Induction and Relevance ReEstimate
par: Huang, Ziyang, et autres
Publié: (2025)
par: Huang, Ziyang, et autres
Publié: (2025)
Adaptive Monitoring and Real-World Evaluation of Agentic AI Systems
par: Shukla, Manish
Publié: (2025)
par: Shukla, Manish
Publié: (2025)
MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes
par: Zhao, Changsheng, et autres
Publié: (2025)
par: Zhao, Changsheng, et autres
Publié: (2025)
OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
ReasonGRM: Enhancing Generative Reward Models through Large Reasoning Models
par: Chen, Bin, et autres
Publié: (2025)
par: Chen, Bin, et autres
Publié: (2025)
Improve Student's Reasoning Generalizability through Cascading Decomposed CoTs Distillation
par: Dai, Chengwei, et autres
Publié: (2024)
par: Dai, Chengwei, et autres
Publié: (2024)
STAR-S: Improving Safety Alignment through Self-Taught Reasoning on Safety Rules
par: Wu, Di, et autres
Publié: (2026)
par: Wu, Di, et autres
Publié: (2026)
Adaptive Margin RLHF via Preference over Preferences
par: Chittepu, Yaswanth, et autres
Publié: (2025)
par: Chittepu, Yaswanth, et autres
Publié: (2025)
Brevity Constraints Reverse Performance Hierarchies in Language Models
par: Hakim, MD Azizul
Publié: (2026)
par: Hakim, MD Azizul
Publié: (2026)
ReIn: Conversational Error Recovery with Reasoning Inception
par: Kim, Takyoung, et autres
Publié: (2026)
par: Kim, Takyoung, et autres
Publié: (2026)
MEDEQUALQA: Evaluating Biases in LLMs with Counterfactual Reasoning
par: Ghosh, Rajarshi, et autres
Publié: (2025)
par: Ghosh, Rajarshi, et autres
Publié: (2025)
GeoGuess: Multimodal Reasoning based on Hierarchy of Visual Information in Street View
par: Cheng, Fenghua, et autres
Publié: (2025)
par: Cheng, Fenghua, et autres
Publié: (2025)
ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
par: Vedula, Bhaskara Hanuma, et autres
Publié: (2026)
Concept-Reversed Winograd Schema Challenge: Evaluating and Improving Robust Reasoning in Large Language Models via Abstraction
par: Han, Kaiqiao, et autres
Publié: (2024)
par: Han, Kaiqiao, et autres
Publié: (2024)
GameArena: Evaluating LLM Reasoning through Live Computer Games
par: Hu, Lanxiang, et autres
Publié: (2024)
par: Hu, Lanxiang, et autres
Publié: (2024)
Status Hierarchies in Language Models
par: Barkett, Emilio
Publié: (2026)
par: Barkett, Emilio
Publié: (2026)
DiReCT: Diagnostic Reasoning for Clinical Notes via Large Language Models
par: Wang, Bowen, et autres
Publié: (2024)
par: Wang, Bowen, et autres
Publié: (2024)
GraCoRe: Benchmarking Graph Comprehension and Complex Reasoning in Large Language Models
par: Yuan, Zike, et autres
Publié: (2024)
par: Yuan, Zike, et autres
Publié: (2024)
Memorization vs. Reasoning: Updating LLMs with New Knowledge
par: Li, Aochong Oliver, et autres
Publié: (2025)
par: Li, Aochong Oliver, et autres
Publié: (2025)
Improving Language Model Reasoning with Self-motivated Learning
par: Feng, Yunlong, et autres
Publié: (2024)
par: Feng, Yunlong, et autres
Publié: (2024)
Documents similaires
-
Router-Suggest: Dynamic Routing for Multimodal Auto-Completion in Visually-Grounded Dialogs
par: Mishra, Sandeep, et autres
Publié: (2026) -
DocQAC: Adaptive Trie-Guided Decoding for Effective In-Document Query Auto-Completion
par: Mehta, Rahul, et autres
Publié: (2026) -
Program of Thoughts for Financial Reasoning: Leveraging Dynamic In-Context Examples and Generative Retrieval
par: Khatuya, Subhendu, et autres
Publié: (2025) -
Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy
par: Dong, Yihong, et autres
Publié: (2026) -
IL-TUR: Benchmark for Indian Legal Text Understanding and Reasoning
par: Joshi, Abhinav, et autres
Publié: (2024)