Core: Robust Factual Precision with Informative Sub-Claim Identification
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Jiang, Zhengping, Zhang, Jingyu, Weir, Nathaniel, Ebner, Seth, Wanner, Miriam, Sanders, Kate, Khashabi, Daniel, Liu, Anqi, Van Durme, Benjamin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Closer Look at Claim Decomposition
par: Wanner, Miriam, et autres
Publié: (2024)
par: Wanner, Miriam, et autres
Publié: (2024)
Conformal Linguistic Calibration: Trading-off between Factuality and Specificity
par: Jiang, Zhengping, et autres
Publié: (2025)
par: Jiang, Zhengping, et autres
Publié: (2025)
TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
DnDScore: Decontextualization and Decomposition for Factuality Verification in Long-Form Text Generation
par: Wanner, Miriam, et autres
Publié: (2024)
par: Wanner, Miriam, et autres
Publié: (2024)
RORA: Robust Free-Text Rationale Evaluation
par: Jiang, Zhengping, et autres
Publié: (2024)
par: Jiang, Zhengping, et autres
Publié: (2024)
All Claims Are Equal, but Some Claims Are More Equal Than Others: Importance-Sensitive Factuality Evaluation of LLM Generations
par: Wanner, Miriam, et autres
Publié: (2025)
par: Wanner, Miriam, et autres
Publié: (2025)
"According to ...": Prompting Language Models Improves Quoting from Pre-Training Data
par: Weller, Orion, et autres
Publié: (2023)
par: Weller, Orion, et autres
Publié: (2023)
Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation
par: Wang, Hexuan, et autres
Publié: (2026)
par: Wang, Hexuan, et autres
Publié: (2026)
NELLIE: A Neuro-Symbolic Inference Engine for Grounded, Compositional, and Explainable Reasoning
par: Weir, Nathaniel, et autres
Publié: (2022)
par: Weir, Nathaniel, et autres
Publié: (2022)
Bonsai: Interpretable Tree-Adaptive Grounded Reasoning
par: Sanders, Kate, et autres
Publié: (2025)
par: Sanders, Kate, et autres
Publié: (2025)
A Survey of Video Datasets for Grounded Event Understanding
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
Always Tell Me The Odds: Fine-grained Conditional Probability Estimation
par: Wang, Liaoyaqi, et autres
Publié: (2025)
par: Wang, Liaoyaqi, et autres
Publié: (2025)
How Grounded is Wikipedia? A Study on Structured Evidential Support and Retrieval
par: Walden, William, et autres
Publié: (2025)
par: Walden, William, et autres
Publié: (2025)
Crystal: Characterizing Relative Impact of Scholarly Publications
par: Collison, Hannah, et autres
Publié: (2026)
par: Collison, Hannah, et autres
Publié: (2026)
Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
Certified Mitigation of Worst-Case LLM Copyright Infringement
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
Enhancing Systematic Decompositional Natural Language Inference Using Informal Logic
par: Weir, Nathaniel, et autres
Publié: (2024)
par: Weir, Nathaniel, et autres
Publié: (2024)
SocialNLI: A Dialogue-Centric Social Inference Dataset
par: Deo, Akhil, et autres
Publié: (2025)
par: Deo, Akhil, et autres
Publié: (2025)
CLAIMCHECK: How Grounded are LLM Critiques of Scientific Papers?
par: Ou, Jiefu, et autres
Publié: (2025)
par: Ou, Jiefu, et autres
Publié: (2025)
Many-Tier Instruction Hierarchy in LLM Agents
par: Zhang, Jingyu, et autres
Publié: (2026)
par: Zhang, Jingyu, et autres
Publié: (2026)
WorldAPIs: The World Is Worth How Many APIs? A Thought Experiment
par: Ou, Jiefu, et autres
Publié: (2024)
par: Ou, Jiefu, et autres
Publié: (2024)
Tur[k]ingBench: A Challenge Benchmark for Web Agents
par: Xu, Kevin, et autres
Publié: (2024)
par: Xu, Kevin, et autres
Publié: (2024)
Defending Against Disinformation Attacks in Open-Domain Question Answering
par: Weller, Orion, et autres
Publié: (2022)
par: Weller, Orion, et autres
Publié: (2022)
Reframing Tax Law Entailment as Analogical Reasoning
par: Zou, Xinrui, et autres
Publié: (2024)
par: Zou, Xinrui, et autres
Publié: (2024)
RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
Weird Generalization is Weirdly Brittle
par: Wanner, Miriam, et autres
Publié: (2026)
par: Wanner, Miriam, et autres
Publié: (2026)
Generating Data-Driven Reasoning Rubrics for Domain-Adaptive Reward Modeling
par: Sanders, Kate, et autres
Publié: (2026)
par: Sanders, Kate, et autres
Publié: (2026)
SemStamp: A Semantic Watermark with Paraphrastic Robustness for Text Generation
par: Hou, Abe Bohan, et autres
Publié: (2023)
par: Hou, Abe Bohan, et autres
Publié: (2023)
Jailbreak Distillation: Renewable Safety Benchmarking
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
Dated Data: Tracing Knowledge Cutoffs in Large Language Models
par: Cheng, Jeffrey, et autres
Publié: (2024)
par: Cheng, Jeffrey, et autres
Publié: (2024)
IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning
par: Mishra, Aayush, et autres
Publié: (2025)
par: Mishra, Aayush, et autres
Publié: (2025)
Steered LLM Activations are Non-Surjective
par: Mishra, Aayush, et autres
Publié: (2026)
par: Mishra, Aayush, et autres
Publié: (2026)
RE-AdaptIR: Improving Information Retrieval through Reverse Engineered Adaptation
par: Fleshman, William, et autres
Publié: (2024)
par: Fleshman, William, et autres
Publié: (2024)
The Alignment Waltz: Jointly Training Agents to Collaborate for Safety
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
NevIR: Negation in Neural Information Retrieval
par: Weller, Orion, et autres
Publié: (2023)
par: Weller, Orion, et autres
Publié: (2023)
Process Supervision of Confidence Margin for Calibrated LLM Reasoning
par: Wang, Liaoyaqi, et autres
Publié: (2026)
par: Wang, Liaoyaqi, et autres
Publié: (2026)
LM Agents for Coordinating Multi-User Information Gathering
par: Jhamtani, Harsh, et autres
Publié: (2025)
par: Jhamtani, Harsh, et autres
Publié: (2025)
Documents similaires
-
A Closer Look at Claim Decomposition
par: Wanner, Miriam, et autres
Publié: (2024) -
Conformal Linguistic Calibration: Trading-off between Factuality and Specificity
par: Jiang, Zhengping, et autres
Publié: (2025) -
TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning
par: Sanders, Kate, et autres
Publié: (2024) -
SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses
par: Jiang, Dongwei, et autres
Publié: (2024) -
DnDScore: Decontextualization and Decomposition for Factuality Verification in Long-Form Text Generation
par: Wanner, Miriam, et autres
Publié: (2024)