P-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains
Fuente:
arXiv
Salvato in:
| Autori principali: | Han, Simeng, Yu, Aaron, Shen, Rui, Qi, Zhenting, Riddell, Martin, Zhou, Wenfei, Qiao, Yujie, Zhao, Yilun, Yavuz, Semih, Liu, Ye, Joty, Shafiq, Zhou, Yingbo, Xiong, Caiming, Radev, Dragomir, Ying, Rex, Cohan, Arman |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
FOLIO: Natural Language Reasoning with First-Order Logic
di: Han, Simeng, et al.
Pubblicazione: (2022)
di: Han, Simeng, et al.
Pubblicazione: (2022)
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
di: Niu, Tong, et al.
Pubblicazione: (2024)
di: Niu, Tong, et al.
Pubblicazione: (2024)
HPE:Answering Complex Questions over Text by Hybrid Question Parsing and Execution
di: Liu, Ye, et al.
Pubblicazione: (2023)
di: Liu, Ye, et al.
Pubblicazione: (2023)
Investigating Factuality in Long-Form Text Generation: The Roles of Self-Known and Self-Unknown
di: Tu, Lifu, et al.
Pubblicazione: (2024)
di: Tu, Lifu, et al.
Pubblicazione: (2024)
CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval
di: Liu, Ye, et al.
Pubblicazione: (2024)
di: Liu, Ye, et al.
Pubblicazione: (2024)
Modeling Uncertainty and Using Post-fusion as Fallback Improves Retrieval Augmented Generation with LLMs
di: Liu, Ye, et al.
Pubblicazione: (2023)
di: Liu, Ye, et al.
Pubblicazione: (2023)
Efficiently Aligned Cross-Lingual Transfer Learning for Conversational Tasks using Prompt-Tuning
di: Tu, Lifu, et al.
Pubblicazione: (2023)
di: Tu, Lifu, et al.
Pubblicazione: (2023)
Benchmarking Generation and Evaluation Capabilities of Large Language Models for Instruction Controllable Summarization
di: Liu, Yixin, et al.
Pubblicazione: (2023)
di: Liu, Yixin, et al.
Pubblicazione: (2023)
Parameter-Efficient Detoxification with Contrastive Decoding
di: Niu, Tong, et al.
Pubblicazione: (2024)
di: Niu, Tong, et al.
Pubblicazione: (2024)
VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?
di: Bansal, Srijan, et al.
Pubblicazione: (2026)
di: Bansal, Srijan, et al.
Pubblicazione: (2026)
Learning from Language Feedback via Variational Policy Distillation
di: Li, Yang, et al.
Pubblicazione: (2026)
di: Li, Yang, et al.
Pubblicazione: (2026)
Foundational Automatic Evaluators: Scaling Multi-Task Generative Evaluator Training for Reasoning-Centric Domains
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
Direct Judgement Preference Optimization
di: Wang, Peifeng, et al.
Pubblicazione: (2024)
di: Wang, Peifeng, et al.
Pubblicazione: (2024)
Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators
di: Zhou, Yilun, et al.
Pubblicazione: (2025)
di: Zhou, Yilun, et al.
Pubblicazione: (2025)
Retrofitting Small Multilingual Models for Retrieval: Matching 7B Performance with 300M Parameters
di: Tu, Lifu, et al.
Pubblicazione: (2025)
di: Tu, Lifu, et al.
Pubblicazione: (2025)
J4R: Learning to Judge with Equivalent Initial State Group Relative Policy Optimization
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
MAS-Orchestra: Understanding and Improving Multi-Agent Reasoning Through Holistic Orchestration and Controlled Benchmarks
di: Ke, Zixuan, et al.
Pubblicazione: (2026)
di: Ke, Zixuan, et al.
Pubblicazione: (2026)
SweRank+: Multilingual, Multi-Turn Code Ranking for Software Issue Localization
di: Reddy, Revanth Gangi, et al.
Pubblicazione: (2025)
di: Reddy, Revanth Gangi, et al.
Pubblicazione: (2025)
Improving LLM Reasoning through Scaling Inference Computation with Collaborative Verification
di: Liang, Zhenwen, et al.
Pubblicazione: (2024)
di: Liang, Zhenwen, et al.
Pubblicazione: (2024)
Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings
di: Xu, Austin, et al.
Pubblicazione: (2025)
di: Xu, Austin, et al.
Pubblicazione: (2025)
SSR: Socratic Self-Refine for Large Language Model Reasoning
di: Shi, Haizhou, et al.
Pubblicazione: (2025)
di: Shi, Haizhou, et al.
Pubblicazione: (2025)
SweRank: Software Issue Localization with Code Ranking
di: Reddy, Revanth Gangi, et al.
Pubblicazione: (2025)
di: Reddy, Revanth Gangi, et al.
Pubblicazione: (2025)
MAS-ProVe: Understanding the Process Verification of Multi-Agent Systems
di: Venkataramani, Vishal, et al.
Pubblicazione: (2026)
di: Venkataramani, Vishal, et al.
Pubblicazione: (2026)
Evaluating Legal Reasoning Traces with Legal Issue Tree Rubrics
di: Lee, Jinu, et al.
Pubblicazione: (2025)
di: Lee, Jinu, et al.
Pubblicazione: (2025)
Table-R1: Inference-Time Scaling for Table Reasoning
di: Yang, Zheyuan, et al.
Pubblicazione: (2025)
di: Yang, Zheyuan, et al.
Pubblicazione: (2025)
Quantifying Contamination in Evaluating Code Generation Capabilities of Language Models
di: Riddell, Martin, et al.
Pubblicazione: (2024)
di: Riddell, Martin, et al.
Pubblicazione: (2024)
HYBRIDMIND: Meta Selection of Natural Language and Symbolic Language for Enhanced LLM Reasoning
di: Han, Simeng, et al.
Pubblicazione: (2024)
di: Han, Simeng, et al.
Pubblicazione: (2024)
SUCEA: Reasoning-Intensive Retrieval for Adversarial Fact-checking through Claim Decomposition and Editing
di: Liu, Hongjun, et al.
Pubblicazione: (2025)
di: Liu, Hongjun, et al.
Pubblicazione: (2025)
Reasoning Curriculum: Bootstrapping Broad LLM Reasoning from Math
di: Pang, Bo, et al.
Pubblicazione: (2025)
di: Pang, Bo, et al.
Pubblicazione: (2025)
StructTest: Benchmarking LLMs' Reasoning through Compositional Structured Outputs
di: Chen, Hailin, et al.
Pubblicazione: (2024)
di: Chen, Hailin, et al.
Pubblicazione: (2024)
Unlocking Anticipatory Text Generation: A Constrained Approach for Large Language Models Decoding
di: Tu, Lifu, et al.
Pubblicazione: (2023)
di: Tu, Lifu, et al.
Pubblicazione: (2023)
Patient-Similarity Cohort Reasoning in Clinical Text-to-SQL
di: Shen, Yifei, et al.
Pubblicazione: (2026)
di: Shen, Yifei, et al.
Pubblicazione: (2026)
LimRank: Less is More for Reasoning-Intensive Information Reranking
di: Song, Tingyu, et al.
Pubblicazione: (2025)
di: Song, Tingyu, et al.
Pubblicazione: (2025)
Beyond Accuracy: Dissecting Mathematical Reasoning for LLMs Under Reinforcement Learning
di: Wang, Jiayu, et al.
Pubblicazione: (2025)
di: Wang, Jiayu, et al.
Pubblicazione: (2025)
References Improve LLM Alignment in Non-Verifiable Domains
di: Shi, Kejian, et al.
Pubblicazione: (2026)
di: Shi, Kejian, et al.
Pubblicazione: (2026)
SciMDR: Advancing Scientific Multimodal Document Reasoning
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
di: Chen, Ziyu, et al.
Pubblicazione: (2026)
ReIFE: Re-evaluating Instruction-Following Evaluation
di: Liu, Yixin, et al.
Pubblicazione: (2024)
di: Liu, Yixin, et al.
Pubblicazione: (2024)
FinanceMath: Knowledge-Intensive Math Reasoning in Finance Domains
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
di: Zhao, Yilun, et al.
Pubblicazione: (2023)
Unlocking Temporal Question Answering for Large Language Models with Tailor-Made Reasoning Logic
di: Li, Xingxuan, et al.
Pubblicazione: (2023)
di: Li, Xingxuan, et al.
Pubblicazione: (2023)
Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
di: Zhao, Yilun, et al.
Pubblicazione: (2026)
Documenti analoghi
-
FOLIO: Natural Language Reasoning with First-Order Logic
di: Han, Simeng, et al.
Pubblicazione: (2022) -
JudgeRank: Leveraging Large Language Models for Reasoning-Intensive Reranking
di: Niu, Tong, et al.
Pubblicazione: (2024) -
HPE:Answering Complex Questions over Text by Hybrid Question Parsing and Execution
di: Liu, Ye, et al.
Pubblicazione: (2023) -
Investigating Factuality in Long-Form Text Generation: The Roles of Self-Known and Self-Unknown
di: Tu, Lifu, et al.
Pubblicazione: (2024) -
CodeXEmbed: A Generalist Embedding Model Family for Multiligual and Multi-task Code Retrieval
di: Liu, Ye, et al.
Pubblicazione: (2024)