ReportLogic: Evaluating Logical Quality in Deep Research Reports
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhao, Jujia, Huan, Zhaoxin, Wang, Zihan, Zhang, Xiaolu, Zhou, Jun, Verberne, Suzan, Ren, Zhaochun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Undesirable Memorization in Large Language Models: A Survey
por: Satvaty, Ali, et al.
Publicado: (2024)
por: Satvaty, Ali, et al.
Publicado: (2024)
Generative Retrieval with Few-shot Indexing
por: Askari, Arian, et al.
Publicado: (2024)
por: Askari, Arian, et al.
Publicado: (2024)
LLMs Enable Bag-of-Texts Representations for Short-Text Clustering
por: Lin, I-Fan, et al.
Publicado: (2025)
por: Lin, I-Fan, et al.
Publicado: (2025)
Improving RAG for Personalization with Author Features and Contrastive Examples
por: Yazan, Mert, et al.
Publicado: (2025)
por: Yazan, Mert, et al.
Publicado: (2025)
The Impact of Quantization on Retrieval-Augmented Generation: An Analysis of Small LLMs
por: Yazan, Mert, et al.
Publicado: (2024)
por: Yazan, Mert, et al.
Publicado: (2024)
LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation
por: Xiao, Yilin, et al.
Publicado: (2026)
por: Xiao, Yilin, et al.
Publicado: (2026)
Unifying Search and Recommendation in LLMs via Gradient Multi-Subspace Tuning
por: Zhao, Jujia, et al.
Publicado: (2026)
por: Zhao, Jujia, et al.
Publicado: (2026)
Dr. Bench: A Multidimensional Evaluation for Deep Research Agents, from Answers to Reports
por: Yao, Yang, et al.
Publicado: (2025)
por: Yao, Yang, et al.
Publicado: (2025)
Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression
por: Peng, Jingyu, et al.
Publicado: (2025)
por: Peng, Jingyu, et al.
Publicado: (2025)
Logic Agent: Enhancing Validity with Logic Rule Invocation
por: Liu, Hanmeng, et al.
Publicado: (2024)
por: Liu, Hanmeng, et al.
Publicado: (2024)
Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond
por: Xu, Fangzhi, et al.
Publicado: (2023)
por: Xu, Fangzhi, et al.
Publicado: (2023)
LogicBench: Towards Systematic Evaluation of Logical Reasoning Ability of Large Language Models
por: Parmar, Mihir, et al.
Publicado: (2024)
por: Parmar, Mihir, et al.
Publicado: (2024)
Lost in the Logic: An Evaluation of Large Language Models' Reasoning Capabilities on LSAT Logic Games
por: Malik, Saumya
Publicado: (2024)
por: Malik, Saumya
Publicado: (2024)
Enhancing RAG Efficiency with Adaptive Context Compression
por: Guo, Shuyu, et al.
Publicado: (2025)
por: Guo, Shuyu, et al.
Publicado: (2025)
LogicPrpBank: A Corpus for Logical Implication and Equivalence
por: Liu, Zhexiong, et al.
Publicado: (2024)
por: Liu, Zhexiong, et al.
Publicado: (2024)
Do Large Language Models Understand Logic or Just Mimick Context?
por: Yan, Junbing, et al.
Publicado: (2024)
por: Yan, Junbing, et al.
Publicado: (2024)
MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization
por: Lyu, Yougang, et al.
Publicado: (2024)
por: Lyu, Yougang, et al.
Publicado: (2024)
SynLogic: Synthesizing Verifiable Reasoning Data at Scale for Learning Logical Reasoning and Beyond
por: Liu, Junteng, et al.
Publicado: (2025)
por: Liu, Junteng, et al.
Publicado: (2025)
GLoRE: Evaluating Logical Reasoning of Large Language Models
por: liu, Hanmeng, et al.
Publicado: (2023)
por: liu, Hanmeng, et al.
Publicado: (2023)
P-FOLIO: Evaluating and Improving Logical Reasoning with Abundant Human-Written Reasoning Chains
por: Han, Simeng, et al.
Publicado: (2024)
por: Han, Simeng, et al.
Publicado: (2024)
MultiZebraLogic: A Multilingual Logical Reasoning Benchmark
por: Bruun, Sofie Helene, et al.
Publicado: (2025)
por: Bruun, Sofie Helene, et al.
Publicado: (2025)
ReportBench: Evaluating Deep Research Agents via Academic Survey Tasks
por: Li, Minghao, et al.
Publicado: (2025)
por: Li, Minghao, et al.
Publicado: (2025)
A Logical Pattern Memory Pre-trained Model for Entailment Tree Generation
por: Yuan, Li, et al.
Publicado: (2024)
por: Yuan, Li, et al.
Publicado: (2024)
Aligning with Logic: Measuring, Evaluating and Improving Logical Preference Consistency in Large Language Models
por: Liu, Yinhong, et al.
Publicado: (2024)
por: Liu, Yinhong, et al.
Publicado: (2024)
Logical Phase Transitions: Understanding Collapse in LLM Logical Reasoning
por: Zhang, Xinglang, et al.
Publicado: (2026)
por: Zhang, Xinglang, et al.
Publicado: (2026)
Bridging Logic and Learning: Decoding Temporal Logic Embeddings via Transformers
por: Candussio, Sara, et al.
Publicado: (2025)
por: Candussio, Sara, et al.
Publicado: (2025)
Logic Augmented Generation
por: Gangemi, Aldo, et al.
Publicado: (2024)
por: Gangemi, Aldo, et al.
Publicado: (2024)
LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models
por: Wan, Yuxuan, et al.
Publicado: (2024)
por: Wan, Yuxuan, et al.
Publicado: (2024)
Abstract Meaning Representation-Based Logic-Driven Data Augmentation for Logical Reasoning
por: Bao, Qiming, et al.
Publicado: (2023)
por: Bao, Qiming, et al.
Publicado: (2023)
Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation
por: Zhang, Chenghao, et al.
Publicado: (2026)
por: Zhang, Chenghao, et al.
Publicado: (2026)
Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning
por: Xie, Tian, et al.
Publicado: (2025)
por: Xie, Tian, et al.
Publicado: (2025)
Reason from Fallacy: Enhancing Large Language Models' Logical Reasoning through Logical Fallacy Understanding
por: Li, Yanda, et al.
Publicado: (2024)
por: Li, Yanda, et al.
Publicado: (2024)
LAG: Logic-Augmented Generation from a Cartesian Perspective
por: Xiao, Yilin, et al.
Publicado: (2025)
por: Xiao, Yilin, et al.
Publicado: (2025)
Logic-Regularized Verifier Elicits Reasoning from LLMs
por: Wang, Xinyu, et al.
Publicado: (2026)
por: Wang, Xinyu, et al.
Publicado: (2026)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
por: Chung, Tsz Ting, et al.
Publicado: (2025)
por: Chung, Tsz Ting, et al.
Publicado: (2025)
LINC: A Neurosymbolic Approach for Logical Reasoning by Combining Language Models with First-Order Logic Provers
por: Olausson, Theo X., et al.
Publicado: (2023)
por: Olausson, Theo X., et al.
Publicado: (2023)
Multi-Step Reasoning with Large Language Models, a Survey
por: Plaat, Aske, et al.
Publicado: (2024)
por: Plaat, Aske, et al.
Publicado: (2024)
Deep Research: A Systematic Survey
por: Shi, Zhengliang, et al.
Publicado: (2025)
por: Shi, Zhengliang, et al.
Publicado: (2025)
Dissecting Logical Reasoning in LLMs: A Fine-Grained Evaluation and Supervision Study
por: Zhou, Yujun, et al.
Publicado: (2025)
por: Zhou, Yujun, et al.
Publicado: (2025)
Beyond Single-shot Writing: Deep Research Agents are Unreliable at Multi-turn Report Revision
por: Chen, Bingsen, et al.
Publicado: (2026)
por: Chen, Bingsen, et al.
Publicado: (2026)
Ejemplares similares
-
Undesirable Memorization in Large Language Models: A Survey
por: Satvaty, Ali, et al.
Publicado: (2024) -
Generative Retrieval with Few-shot Indexing
por: Askari, Arian, et al.
Publicado: (2024) -
LLMs Enable Bag-of-Texts Representations for Short-Text Clustering
por: Lin, I-Fan, et al.
Publicado: (2025) -
Improving RAG for Personalization with Author Features and Contrastive Examples
por: Yazan, Mert, et al.
Publicado: (2025) -
The Impact of Quantization on Retrieval-Augmented Generation: An Analysis of Small LLMs
por: Yazan, Mert, et al.
Publicado: (2024)