Enregistré dans:
| Auteurs principaux: | Dou, Guangyao, Brena, Luis, Deo, Akhil, Jurayj, William, Zhang, Jingyu, Holzenberger, Nils, Van Durme, Benjamin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.04443 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Language Models and Logic Programs for Trustworthy Tax Reasoning
par: Jurayj, William, et autres
Publié: (2025)
par: Jurayj, William, et autres
Publié: (2025)
Gaps or Hallucinations? Gazing into Machine-Generated Legal Analysis for Fine-grained Text Evaluations
par: Hou, Abe Bohan, et autres
Publié: (2024)
par: Hou, Abe Bohan, et autres
Publié: (2024)
Is That Your Final Answer? Test-Time Scaling Improves Selective Question Answering
par: Jurayj, William, et autres
Publié: (2025)
par: Jurayj, William, et autres
Publié: (2025)
Reframing Tax Law Entailment as Analogical Reasoning
par: Zou, Xinrui, et autres
Publié: (2024)
par: Zou, Xinrui, et autres
Publié: (2024)
SocialNLI: A Dialogue-Centric Social Inference Dataset
par: Deo, Akhil, et autres
Publié: (2025)
par: Deo, Akhil, et autres
Publié: (2025)
OpenAI Cribbed Our Tax Example, But Can GPT-4 Really Do Tax?
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
Process Supervision of Confidence Margin for Calibrated LLM Reasoning
par: Wang, Liaoyaqi, et autres
Publié: (2026)
par: Wang, Liaoyaqi, et autres
Publié: (2026)
Many-Tier Instruction Hierarchy in LLM Agents
par: Zhang, Jingyu, et autres
Publié: (2026)
par: Zhang, Jingyu, et autres
Publié: (2026)
BLT: Can Large Language Models Handle Basic Legal Text?
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
par: Blair-Stanek, Andrew, et autres
Publié: (2023)
Weird Generalization is Weirdly Brittle
par: Wanner, Miriam, et autres
Publié: (2026)
par: Wanner, Miriam, et autres
Publié: (2026)
Can LLMs Identify Tax Abuse?
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
CLERC: A Dataset for Legal Case Retrieval and Retrieval-Augmented Analysis Generation
par: Hou, Abe Bohan, et autres
Publié: (2024)
par: Hou, Abe Bohan, et autres
Publié: (2024)
Compressed Chain of Thought: Efficient Reasoning Through Dense Representations
par: Cheng, Jeffrey, et autres
Publié: (2024)
par: Cheng, Jeffrey, et autres
Publié: (2024)
Are Finer Citations Always Better? Rethinking Granularity for Attributed Generation
par: Wang, Hexuan, et autres
Publié: (2026)
par: Wang, Hexuan, et autres
Publié: (2026)
Tur[k]ingBench: A Challenge Benchmark for Web Agents
par: Xu, Kevin, et autres
Publié: (2024)
par: Xu, Kevin, et autres
Publié: (2024)
BenchCLAMP: A Benchmark for Evaluating Language Models on Syntactic and Semantic Parsing
par: Roy, Subhro, et autres
Publié: (2022)
par: Roy, Subhro, et autres
Publié: (2022)
Verifiable by Design: Aligning Language Models to Quote from Pre-Training Data
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
Certified Mitigation of Worst-Case LLM Copyright Infringement
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
SEQR: Secure and Efficient QR-based LoRA Routing
par: Fleshman, William, et autres
Publié: (2025)
par: Fleshman, William, et autres
Publié: (2025)
LoRA-Augmented Generation (LAG) for Knowledge-Intensive Language Tasks
par: Fleshman, William, et autres
Publié: (2025)
par: Fleshman, William, et autres
Publié: (2025)
RE-Adapt: Reverse Engineered Adaptation of Large Language Models
par: Fleshman, William, et autres
Publié: (2024)
par: Fleshman, William, et autres
Publié: (2024)
SpectR: Dynamically Composing LM Experts with Spectral Routing
par: Fleshman, William, et autres
Publié: (2025)
par: Fleshman, William, et autres
Publié: (2025)
NELLIE: A Neuro-Symbolic Inference Engine for Grounded, Compositional, and Explainable Reasoning
par: Weir, Nathaniel, et autres
Publié: (2022)
par: Weir, Nathaniel, et autres
Publié: (2022)
Bonsai: Interpretable Tree-Adaptive Grounded Reasoning
par: Sanders, Kate, et autres
Publié: (2025)
par: Sanders, Kate, et autres
Publié: (2025)
Investigating the Feasibility of Mitigating Potential Copyright Infringement via Large Language Model Unlearning
par: Dou, Guangyao
Publié: (2024)
par: Dou, Guangyao
Publié: (2024)
Controllable Safety Alignment: Inference-Time Adaptation to Diverse Safety Requirements
par: Zhang, Jingyu, et autres
Publié: (2024)
par: Zhang, Jingyu, et autres
Publié: (2024)
RE-AdaptIR: Improving Information Retrieval through Reverse Engineered Adaptation
par: Fleshman, William, et autres
Publié: (2024)
par: Fleshman, William, et autres
Publié: (2024)
LELA: an LLM-based Entity Linking Approach with Zero-Shot Domain Adaptation
par: Haffoudhi, Samy, et autres
Publié: (2026)
par: Haffoudhi, Samy, et autres
Publié: (2026)
RATIONALYST: Mining Implicit Rationales for Process Supervision of Reasoning
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
Jailbreak Distillation: Renewable Safety Benchmarking
par: Zhang, Jingyu, et autres
Publié: (2025)
par: Zhang, Jingyu, et autres
Publié: (2025)
Compactor: Calibrated Query-Agnostic KV Cache Compression with Approximate Leverage Scores
par: Chari, Vivek, et autres
Publié: (2025)
par: Chari, Vivek, et autres
Publié: (2025)
LLMs Provide Unstable Answers to Legal Questions
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
par: Blair-Stanek, Andrew, et autres
Publié: (2025)
LELA: An End-to-end LLM-based Entity Linking Framework with Zero-shot Domain Adaptation
par: Haffoudhi, Samy, et autres
Publié: (2026)
par: Haffoudhi, Samy, et autres
Publié: (2026)
TV-TREES: Multimodal Entailment Trees for Neuro-Symbolic Video Reasoning
par: Sanders, Kate, et autres
Publié: (2024)
par: Sanders, Kate, et autres
Publié: (2024)
Unified Multimodal Uncertain Inference
par: Zhang, Dengjia, et autres
Publié: (2026)
par: Zhang, Dengjia, et autres
Publié: (2026)
SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses
par: Jiang, Dongwei, et autres
Publié: (2024)
par: Jiang, Dongwei, et autres
Publié: (2024)
arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation
par: Wang, Weiqi, et autres
Publié: (2025)
par: Wang, Weiqi, et autres
Publié: (2025)
DnDScore: Decontextualization and Decomposition for Factuality Verification in Long-Form Text Generation
par: Wanner, Miriam, et autres
Publié: (2024)
par: Wanner, Miriam, et autres
Publié: (2024)
Evaluation of Deontic Conditional Reasoning in Large Language Models: The Case of Wason's Selection Task
par: Abe, Hirohiko, et autres
Publié: (2026)
par: Abe, Hirohiko, et autres
Publié: (2026)
AdapterSwap: Continuous Training of LLMs with Data Removal and Access-Control Guarantees
par: Fleshman, William, et autres
Publié: (2024)
par: Fleshman, William, et autres
Publié: (2024)
Documents similaires
-
Language Models and Logic Programs for Trustworthy Tax Reasoning
par: Jurayj, William, et autres
Publié: (2025) -
Gaps or Hallucinations? Gazing into Machine-Generated Legal Analysis for Fine-grained Text Evaluations
par: Hou, Abe Bohan, et autres
Publié: (2024) -
Is That Your Final Answer? Test-Time Scaling Improves Selective Question Answering
par: Jurayj, William, et autres
Publié: (2025) -
Reframing Tax Law Entailment as Analogical Reasoning
par: Zou, Xinrui, et autres
Publié: (2024) -
SocialNLI: A Dialogue-Centric Social Inference Dataset
par: Deo, Akhil, et autres
Publié: (2025)