A Reality Check of Language Models as Formalizers on Constraint Satisfaction Problems
Fuente:
arXiv
Salvato in:
| Autori principali: | Amonkar, Rikhil, Kayan, Ceyhun Efe, Lai, Qimei, Bras, Ronan Le, Zhang, Li |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Prototype-Based Dynamic Steering for Large Language Models
di: Kayan, Ceyhun Efe, et al.
Pubblicazione: (2025)
di: Kayan, Ceyhun Efe, et al.
Pubblicazione: (2025)
From Dogwhistles to Bullhorns: Unveiling Coded Rhetoric with Language Models
di: Mendelsohn, Julia, et al.
Pubblicazione: (2023)
di: Mendelsohn, Julia, et al.
Pubblicazione: (2023)
Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language Models
di: Baheti, Ashutosh, et al.
Pubblicazione: (2023)
di: Baheti, Ashutosh, et al.
Pubblicazione: (2023)
MacGyver: Are Large Language Models Creative Problem Solvers?
di: Tian, Yufei, et al.
Pubblicazione: (2023)
di: Tian, Yufei, et al.
Pubblicazione: (2023)
Language Model as Planner and Formalizer under Constraints
di: Huang, Cassie, et al.
Pubblicazione: (2025)
di: Huang, Cassie, et al.
Pubblicazione: (2025)
The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check
di: Lu, Qingyu, et al.
Pubblicazione: (2026)
di: Lu, Qingyu, et al.
Pubblicazione: (2026)
LR^2Bench: Evaluating Long-chain Reflective Reasoning Capabilities of Large Language Models via Constraint Satisfaction Problems
di: Chen, Jianghao, et al.
Pubblicazione: (2025)
di: Chen, Jianghao, et al.
Pubblicazione: (2025)
LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
di: Zhang, Kaichen, et al.
Pubblicazione: (2024)
On Classifying Continuous Constraint Satisfaction Problems
di: Miltzow, Tillmann, et al.
Pubblicazione: (2021)
di: Miltzow, Tillmann, et al.
Pubblicazione: (2021)
Efficient Algorithms for Partial Constraint Satisfaction Problems over Control-flow Graphs
di: Cai, Xuran, et al.
Pubblicazione: (2026)
di: Cai, Xuran, et al.
Pubblicazione: (2026)
Orthographic Constraint Satisfaction and Human Difficulty Alignment in Large Language Models
di: Tuck, Bryan E., et al.
Pubblicazione: (2025)
di: Tuck, Bryan E., et al.
Pubblicazione: (2025)
A Call for Clarity in Beam Search: How It Works and When It Stops
di: Kasai, Jungo, et al.
Pubblicazione: (2022)
di: Kasai, Jungo, et al.
Pubblicazione: (2022)
FMC: Formalization of Natural Language Mathematical Competition Problems
di: Xie, Jiaxuan, et al.
Pubblicazione: (2025)
di: Xie, Jiaxuan, et al.
Pubblicazione: (2025)
GPU-Accelerated Simulated Oscillator Ising/Potts Machine Solving Combinatorial Optimization Problems
di: Gonul, Yilmaz Ege, et al.
Pubblicazione: (2025)
di: Gonul, Yilmaz Ege, et al.
Pubblicazione: (2025)
On the Limit of Language Models as Planning Formalizers
di: Huang, Cassie, et al.
Pubblicazione: (2024)
di: Huang, Cassie, et al.
Pubblicazione: (2024)
Temporal Generalization: A Reality Check
di: Madaan, Divyam, et al.
Pubblicazione: (2025)
di: Madaan, Divyam, et al.
Pubblicazione: (2025)
Efficient Solving for Dynamic Data Structure Constraint Satisfaction Problem
di: Li, Nanbing, et al.
Pubblicazione: (2026)
di: Li, Nanbing, et al.
Pubblicazione: (2026)
Complexity Classification of Complex-Weighted Counting Acyclic Constraint Satisfaction Problems
di: Yamakami, Tomoyuki
Pubblicazione: (2024)
di: Yamakami, Tomoyuki
Pubblicazione: (2024)
Attention Satisfies: A Constraint-Satisfaction Lens on Factual Errors of Language Models
di: Yuksekgonul, Mert, et al.
Pubblicazione: (2023)
di: Yuksekgonul, Mert, et al.
Pubblicazione: (2023)
ClaimCheck: Real-Time Fact-Checking with Small Language Models
di: Putta, Akshith Reddy, et al.
Pubblicazione: (2025)
di: Putta, Akshith Reddy, et al.
Pubblicazione: (2025)
Formal Aspects of Language Modeling
di: Cotterell, Ryan, et al.
Pubblicazione: (2023)
di: Cotterell, Ryan, et al.
Pubblicazione: (2023)
Taxonomy-based CheckList for Large Language Model Evaluation
di: Zhang, Damin
Pubblicazione: (2023)
di: Zhang, Damin
Pubblicazione: (2023)
Formal Constraints on Dependency Syntax
di: Gómez-Rodríguez, et al.
Pubblicazione: (2026)
di: Gómez-Rodríguez, et al.
Pubblicazione: (2026)
Language Model Planners do not Scale, but do Formalizers?
di: Jiang, Owen, et al.
Pubblicazione: (2026)
di: Jiang, Owen, et al.
Pubblicazione: (2026)
Scaling Laws Are Unreliable for Downstream Tasks: A Reality Check
di: Lourie, Nicholas, et al.
Pubblicazione: (2025)
di: Lourie, Nicholas, et al.
Pubblicazione: (2025)
Formal Semantic Control over Language Models
di: Zhang, Yingji
Pubblicazione: (2026)
di: Zhang, Yingji
Pubblicazione: (2026)
SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs
di: Gu, Yuling, et al.
Pubblicazione: (2024)
di: Gu, Yuling, et al.
Pubblicazione: (2024)
A Reality Check on Context Utilisation for Retrieval-Augmented Generation
di: Hagström, Lovisa, et al.
Pubblicazione: (2024)
di: Hagström, Lovisa, et al.
Pubblicazione: (2024)
Self-Checker: Plug-and-Play Modules for Fact-Checking with Large Language Models
di: Li, Miaoran, et al.
Pubblicazione: (2023)
di: Li, Miaoran, et al.
Pubblicazione: (2023)
Multi-Attribute Constraint Satisfaction via Language Model Rewriting
di: Baheti, Ashutosh, et al.
Pubblicazione: (2024)
di: Baheti, Ashutosh, et al.
Pubblicazione: (2024)
From Informal to Formal -- Incorporating and Evaluating LLMs on Natural Language Requirements to Verifiable Formal Proofs
di: Cao, Jialun, et al.
Pubblicazione: (2025)
di: Cao, Jialun, et al.
Pubblicazione: (2025)
Vision Language Models Cannot Plan, but Can They Formalize?
di: He, Muyu, et al.
Pubblicazione: (2025)
di: He, Muyu, et al.
Pubblicazione: (2025)
Evaluating Large Language Model Capability in Vietnamese Fact-Checking Data Generation
di: To, Long Truong, et al.
Pubblicazione: (2024)
di: To, Long Truong, et al.
Pubblicazione: (2024)
Evaluating Task-Oriented Dialogue Consistency through Constraint Satisfaction
di: Labruna, Tiziano, et al.
Pubblicazione: (2024)
di: Labruna, Tiziano, et al.
Pubblicazione: (2024)
Do We Need Language-Specific Fact-Checking Models? The Case of Chinese
di: Zhang, Caiqi, et al.
Pubblicazione: (2024)
di: Zhang, Caiqi, et al.
Pubblicazione: (2024)
NILE: Formalizing Natural-Language Descriptions of Formal Languages
di: Kneisel, Tristan, et al.
Pubblicazione: (2026)
di: Kneisel, Tristan, et al.
Pubblicazione: (2026)
Generative Large Language Models in Automated Fact-Checking: A Survey
di: Vykopal, Ivan, et al.
Pubblicazione: (2024)
di: Vykopal, Ivan, et al.
Pubblicazione: (2024)
From Algebraic Word Problem to Program: A Formalized Approach
di: Wiemerslage, Adam, et al.
Pubblicazione: (2020)
di: Wiemerslage, Adam, et al.
Pubblicazione: (2020)
A Vision Check-up for Language Models
di: Sharma, Pratyusha, et al.
Pubblicazione: (2024)
di: Sharma, Pratyusha, et al.
Pubblicazione: (2024)
MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts
di: He, Jiayi, et al.
Pubblicazione: (2025)
di: He, Jiayi, et al.
Pubblicazione: (2025)
Documenti analoghi
-
Prototype-Based Dynamic Steering for Large Language Models
di: Kayan, Ceyhun Efe, et al.
Pubblicazione: (2025) -
From Dogwhistles to Bullhorns: Unveiling Coded Rhetoric with Language Models
di: Mendelsohn, Julia, et al.
Pubblicazione: (2023) -
Leftover Lunch: Advantage-based Offline Reinforcement Learning for Language Models
di: Baheti, Ashutosh, et al.
Pubblicazione: (2023) -
MacGyver: Are Large Language Models Creative Problem Solvers?
di: Tian, Yufei, et al.
Pubblicazione: (2023) -
Language Model as Planner and Formalizer under Constraints
di: Huang, Cassie, et al.
Pubblicazione: (2025)