Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Huang, Youcheng, Qin, Bowen, Huang, Chen, Feng, Duanyu, Yang, Xi, Lei, Wenqiang |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DREditor: An Time-efficient Approach for Building a Domain-specific Dense Retrieval Model
par: Huang, Chen, et autres
Publié: (2024)
par: Huang, Chen, et autres
Publié: (2024)
STAR: Semantic-Tuned and Tail-Adaptive Retriever for Graph-Augmented Generation
par: Li, Shuai, et autres
Publié: (2026)
par: Li, Shuai, et autres
Publié: (2026)
Unlocking Biological Workflows for Robust Protein-Text Question Answering: A Dual-Dimensional RAG Framework
par: Ding, Li, et autres
Publié: (2026)
par: Ding, Li, et autres
Publié: (2026)
Knowing When to Ask -- Bridging Large Language Models and Data
par: Radhakrishnan, Prashanth, et autres
Publié: (2024)
par: Radhakrishnan, Prashanth, et autres
Publié: (2024)
Ask Optimal Questions: Aligning Large Language Models with Retriever's Preference in Conversation
par: Yoon, Chanwoong, et autres
Publié: (2024)
par: Yoon, Chanwoong, et autres
Publié: (2024)
Cross-model Transferability among Large Language Models on the Platonic Representations of Concepts
par: Huang, Youcheng, et autres
Publié: (2025)
par: Huang, Youcheng, et autres
Publié: (2025)
Legend: Leveraging Representation Engineering to Annotate Safety Margin for Preference Datasets
par: Feng, Duanyu, et autres
Publié: (2024)
par: Feng, Duanyu, et autres
Publié: (2024)
Large Language Models as Evaluators for Recommendation Explanations
par: Zhang, Xiaoyu, et autres
Publié: (2024)
par: Zhang, Xiaoyu, et autres
Publié: (2024)
Can LLMs Master Math? Investigating Large Language Models on Math Stack Exchange
par: Satpute, Ankit, et autres
Publié: (2024)
par: Satpute, Ankit, et autres
Publié: (2024)
PaperAsk: A Benchmark for Reliability Evaluation of LLMs in Paper Search and Reading
par: Wu, Yutao, et autres
Publié: (2025)
par: Wu, Yutao, et autres
Publié: (2025)
Learning to Ask: Conversational Product Search via Representation Learning
par: Zou, Jie, et autres
Publié: (2024)
par: Zou, Jie, et autres
Publié: (2024)
A Comprehensive Evaluation of Large Language Models on Temporal Event Forecasting
par: Chang, He, et autres
Publié: (2024)
par: Chang, He, et autres
Publié: (2024)
Two-way Evidence self-Alignment based Dual-Gated Reasoning Enhancement
par: Zhang, Kexin, et autres
Publié: (2025)
par: Zhang, Kexin, et autres
Publié: (2025)
Beyond Relevant Documents: A Knowledge-Intensive Approach for Query-Focused Summarization using Large Language Models
par: Zhang, Weijia, et autres
Publié: (2024)
par: Zhang, Weijia, et autres
Publié: (2024)
InstUPR : Instruction-based Unsupervised Passage Reranking with Large Language Models
par: Huang, Chao-Wei, et autres
Publié: (2024)
par: Huang, Chao-Wei, et autres
Publié: (2024)
Improving Text Embeddings with Large Language Models
par: Wang, Liang, et autres
Publié: (2023)
par: Wang, Liang, et autres
Publié: (2023)
ResearchArena: Benchmarking Large Language Models' Ability to Collect and Organize Information as Research Agents
par: Kang, Hao, et autres
Publié: (2024)
par: Kang, Hao, et autres
Publié: (2024)
Evaluating the Ability of Computationally Extracted Narrative Maps to Encode Media Framing
par: Macías, Sebastián Concha, et autres
Publié: (2024)
par: Macías, Sebastián Concha, et autres
Publié: (2024)
Large Search Model: Redefining Search Stack in the Era of LLMs
par: Wang, Liang, et autres
Publié: (2023)
par: Wang, Liang, et autres
Publié: (2023)
Beyond Relevance: Evaluate and Improve Retrievers on Perspective Awareness
par: Zhao, Xinran, et autres
Publié: (2024)
par: Zhao, Xinran, et autres
Publié: (2024)
Beyond Words: Evaluating Large Language Models in Transportation Planning
par: Ying, Shaowei, et autres
Publié: (2024)
par: Ying, Shaowei, et autres
Publié: (2024)
Self-Retrieval: End-to-End Information Retrieval with One Large Language Model
par: Tang, Qiaoyu, et autres
Publié: (2024)
par: Tang, Qiaoyu, et autres
Publié: (2024)
CLARINET: Augmenting Language Models to Ask Clarification Questions for Retrieval
par: Chi, Yizhou, et autres
Publié: (2024)
par: Chi, Yizhou, et autres
Publié: (2024)
MDEval: Evaluating and Enhancing Markdown Awareness in Large Language Models
par: Chen, Zhongpu, et autres
Publié: (2025)
par: Chen, Zhongpu, et autres
Publié: (2025)
ScholarSearch: Benchmarking Scholar Searching Ability of LLMs
par: Zhou, Junting, et autres
Publié: (2025)
par: Zhou, Junting, et autres
Publié: (2025)
LANE: Logic Alignment of Non-tuning Large Language Models and Online Recommendation Systems for Explainable Reason Generation
par: Zhao, Hongke, et autres
Publié: (2024)
par: Zhao, Hongke, et autres
Publié: (2024)
Beyond Static Dialogues: Benchmarking Realistic, Heterogeneous, and Evolving Long-Term Memory
par: Zhang, Han, et autres
Publié: (2026)
par: Zhang, Han, et autres
Publié: (2026)
RALLRec: Improving Retrieval Augmented Large Language Model Recommendation with Representation Learning
par: Xu, Jian, et autres
Publié: (2025)
par: Xu, Jian, et autres
Publié: (2025)
ClarifyMT-Bench: Benchmarking and Improving Multi-Turn Clarification for Conversational Large Language Models
par: Luo, Sichun, et autres
Publié: (2025)
par: Luo, Sichun, et autres
Publié: (2025)
Large Language Models for Information Retrieval: A Survey
par: Zhu, Yutao, et autres
Publié: (2023)
par: Zhu, Yutao, et autres
Publié: (2023)
Generative Multi-Modal Knowledge Retrieval with Large Language Models
par: Long, Xinwei, et autres
Publié: (2024)
par: Long, Xinwei, et autres
Publié: (2024)
Graph Chain-of-Thought: Augmenting Large Language Models by Reasoning on Graphs
par: Jin, Bowen, et autres
Publié: (2024)
par: Jin, Bowen, et autres
Publié: (2024)
Hallucination Detection and Evaluation of Large Language Model
par: Zhang, Chenggong, et autres
Publié: (2025)
par: Zhang, Chenggong, et autres
Publié: (2025)
A Survey on Retrieval-Augmented Text Generation for Large Language Models
par: Huang, Yizheng, et autres
Publié: (2024)
par: Huang, Yizheng, et autres
Publié: (2024)
DRAMA: Diverse Augmentation from Large Language Models to Smaller Dense Retrievers
par: Ma, Xueguang, et autres
Publié: (2025)
par: Ma, Xueguang, et autres
Publié: (2025)
Beyond Chains: Bridging Large Language Models and Knowledge Bases in Complex Question Answering
par: Zhu, Yihua, et autres
Publié: (2025)
par: Zhu, Yihua, et autres
Publié: (2025)
Evaluating LLM Abilities to Understand Tabular Electronic Health Records: A Comprehensive Study of Patient Data Extraction and Retrieval
par: Lovon, Jesus, et autres
Publié: (2025)
par: Lovon, Jesus, et autres
Publié: (2025)
Best Practices for Distilling Large Language Models into BERT for Web Search Ranking
par: Ye, Dezhi, et autres
Publié: (2024)
par: Ye, Dezhi, et autres
Publié: (2024)
Evaluating Large Language Models for Cross-Lingual Retrieval
par: Zuo, Longfei, et autres
Publié: (2025)
par: Zuo, Longfei, et autres
Publié: (2025)
LimRank: Less is More for Reasoning-Intensive Information Reranking
par: Song, Tingyu, et autres
Publié: (2025)
par: Song, Tingyu, et autres
Publié: (2025)
Documents similaires
-
DREditor: An Time-efficient Approach for Building a Domain-specific Dense Retrieval Model
par: Huang, Chen, et autres
Publié: (2024) -
STAR: Semantic-Tuned and Tail-Adaptive Retriever for Graph-Augmented Generation
par: Li, Shuai, et autres
Publié: (2026) -
Unlocking Biological Workflows for Robust Protein-Text Question Answering: A Dual-Dimensional RAG Framework
par: Ding, Li, et autres
Publié: (2026) -
Knowing When to Ask -- Bridging Large Language Models and Data
par: Radhakrishnan, Prashanth, et autres
Publié: (2024) -
Ask Optimal Questions: Aligning Large Language Models with Retriever's Preference in Conversation
par: Yoon, Chanwoong, et autres
Publié: (2024)