Refining Critical Thinking in LLM Code Generation: A Faulty Premise-based Evaluation Framework
Fuente:
arXiv
Saved in:
| Main Authors: | Li, Jialin, Li, Jinzhe, Li, Gengxu, Chang, Yi, Wu, Yuan |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models
by: Li, Jinzhe, et al.
Published: (2025)
by: Li, Jinzhe, et al.
Published: (2025)
Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability
by: Yang, Haiqi, et al.
Published: (2025)
by: Yang, Haiqi, et al.
Published: (2025)
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
by: Fan, Chenrui, et al.
Published: (2025)
by: Fan, Chenrui, et al.
Published: (2025)
Useful Memories Become Faulty When Continuously Updated by LLMs
by: Zhang, Dylan, et al.
Published: (2026)
by: Zhang, Dylan, et al.
Published: (2026)
On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents
by: Huang, Jen-tse, et al.
Published: (2024)
by: Huang, Jen-tse, et al.
Published: (2024)
Memorize or Generalize? Evaluating LLM Code Generation with Code Rewriting
by: Zhang, Lizhe, et al.
Published: (2025)
by: Zhang, Lizhe, et al.
Published: (2025)
Search and Refine During Think: Facilitating Knowledge Refinement for Improved Retrieval-Augmented Reasoning
by: Shi, Yaorui, et al.
Published: (2025)
by: Shi, Yaorui, et al.
Published: (2025)
Uncertainty Quantification for LLM-based Code Generation
by: Xu, Senrong, et al.
Published: (2026)
by: Xu, Senrong, et al.
Published: (2026)
A Unified Framework for the Evaluation of LLM Agentic Capabilities
by: Zhu, Pengyu, et al.
Published: (2026)
by: Zhu, Pengyu, et al.
Published: (2026)
FasterPy: An LLM-based Code Execution Efficiency Optimization Framework
by: Wu, Yue, et al.
Published: (2025)
by: Wu, Yue, et al.
Published: (2025)
Thinking Before Running! Efficient Code Generation with Thorough Exploration and Optimal Refinement
by: Zhang, Xiaoqing, et al.
Published: (2024)
by: Zhang, Xiaoqing, et al.
Published: (2024)
RELATE: A Reinforcement Learning-Enhanced LLM Framework for Advertising Text Generation
by: Wang, Jinfang, et al.
Published: (2026)
by: Wang, Jinfang, et al.
Published: (2026)
Zero Token-Driven Deep Thinking in LLMs: Unlocking the Full Potential of Existing Parameters via Cyclic Refinement
by: Li, Guanghao, et al.
Published: (2025)
by: Li, Guanghao, et al.
Published: (2025)
Vendor-Aware Industrial Agents: RAG-Enhanced LLMs for Secure On-Premise PLC Code Generation
by: Kersting, Joschka, et al.
Published: (2025)
by: Kersting, Joschka, et al.
Published: (2025)
Geo-Code: A Code Framework for Reverse Code Generation from Geometric Images Based on Two-Stage Multi-Agent Evolution
by: Wu, Zhenyu, et al.
Published: (2026)
by: Wu, Zhenyu, et al.
Published: (2026)
ThinkRec: Thinking-based recommendation via LLM
by: Yu, Qihang, et al.
Published: (2025)
by: Yu, Qihang, et al.
Published: (2025)
Don't Let It Hallucinate: Premise Verification via Retrieval-Augmented Logical Reasoning
by: Qin, Yuehan, et al.
Published: (2025)
by: Qin, Yuehan, et al.
Published: (2025)
Metaphors We Compute By: A Computational Audit of Cultural Translation vs. Thinking in LLMs
by: Chang, Yuan, et al.
Published: (2026)
by: Chang, Yuan, et al.
Published: (2026)
Reasoning as a Resource: Optimizing Fast and Slow Thinking in Code Generation Models
by: Li, Zongjie, et al.
Published: (2025)
by: Li, Zongjie, et al.
Published: (2025)
Tools Fail: Detecting Silent Errors in Faulty Tools
by: Sun, Jimin, et al.
Published: (2024)
by: Sun, Jimin, et al.
Published: (2024)
A Middle Path for On-Premises LLM Deployment: Preserving Privacy Without Sacrificing Model Confidentiality
by: Huang, Hanbo, et al.
Published: (2024)
by: Huang, Hanbo, et al.
Published: (2024)
A Framework for Human-AI Q-Matrix Refinement: A NeuralCDM Evaluation
by: Zhang, Ying, et al.
Published: (2026)
by: Zhang, Ying, et al.
Published: (2026)
ParaGAN: A Scalable Distributed Training Framework for Generative Adversarial Networks
by: Shi, Ziji, et al.
Published: (2024)
by: Shi, Ziji, et al.
Published: (2024)
Unlocking Recursive Thinking of LLMs: Alignment via Refinement
by: Zhang, Haoke, et al.
Published: (2025)
by: Zhang, Haoke, et al.
Published: (2025)
Learning to Plan & Reason for Evaluation with Thinking-LLM-as-a-Judge
by: Saha, Swarnadeep, et al.
Published: (2025)
by: Saha, Swarnadeep, et al.
Published: (2025)
ReCode: Improving LLM-based Code Repair with Fine-Grained Retrieval-Augmented Generation
by: Zhao, Yicong, et al.
Published: (2025)
by: Zhao, Yicong, et al.
Published: (2025)
Visual Prompting with Iterative Refinement for Design Critique Generation
by: Duan, Peitong, et al.
Published: (2024)
by: Duan, Peitong, et al.
Published: (2024)
InfCode: Adversarial Iterative Refinement of Tests and Patches for Reliable Software Issue Resolution
by: Li, KeFan, et al.
Published: (2025)
by: Li, KeFan, et al.
Published: (2025)
Disentangle-then-Refine: LLM-Guided Decoupling and Structure-Aware Refinement for Graph Contrastive Learning
by: Li, Zhaoxing, et al.
Published: (2026)
by: Li, Zhaoxing, et al.
Published: (2026)
CodeRefine: A Pipeline for Enhancing LLM-Generated Code Implementations of Research Papers
by: Trofimova, Ekaterina, et al.
Published: (2024)
by: Trofimova, Ekaterina, et al.
Published: (2024)
A Pair Programming Framework for Code Generation via Multi-Plan Exploration and Feedback-Driven Refinement
by: Zhang, Huan, et al.
Published: (2024)
by: Zhang, Huan, et al.
Published: (2024)
GVGAI-LLM: Evaluating Large Language Model Agents with Infinite Games
by: Li, Yuchen, et al.
Published: (2025)
by: Li, Yuchen, et al.
Published: (2025)
Evaluation and LLM-Guided Learning of ICD Coding Rationales
by: Li, Mingyang, et al.
Published: (2025)
by: Li, Mingyang, et al.
Published: (2025)
Code Copycat Conundrum: Demystifying Repetition in LLM-based Code Generation
by: Liu, Mingwei, et al.
Published: (2025)
by: Liu, Mingwei, et al.
Published: (2025)
LegalWebAgent: Empowering Access to Justice via LLM-Based Web Agents
by: Tan, Jinzhe, et al.
Published: (2025)
by: Tan, Jinzhe, et al.
Published: (2025)
KG-FPQ: Evaluating Factuality Hallucination in LLMs with Knowledge Graph-based False Premise Questions
by: Zhu, Yanxu, et al.
Published: (2024)
by: Zhu, Yanxu, et al.
Published: (2024)
Judge Before Answer: Can MLLM Discern the False Premise in Question?
by: Li, Jidong, et al.
Published: (2025)
by: Li, Jidong, et al.
Published: (2025)
Web-Bench: A LLM Code Benchmark Based on Web Standards and Frameworks
by: Xu, Kai, et al.
Published: (2025)
by: Xu, Kai, et al.
Published: (2025)
Enhancing LLM Reasoning for Time Series Classification by Tailored Thinking and Fused Decision
by: Zhou, Jiahui, et al.
Published: (2025)
by: Zhou, Jiahui, et al.
Published: (2025)
Leveraging LLMs as Meta-Judges: A Multi-Agent Framework for Evaluating LLM Judgments
by: Li, Yuran, et al.
Published: (2025)
by: Li, Yuran, et al.
Published: (2025)
Similar Items
-
Don't Take the Premise for Granted: Evaluating the Premise Critique Ability of Large Language Models
by: Li, Jinzhe, et al.
Published: (2025) -
Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability
by: Yang, Haiqi, et al.
Published: (2025) -
Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?
by: Fan, Chenrui, et al.
Published: (2025) -
Useful Memories Become Faulty When Continuously Updated by LLMs
by: Zhang, Dylan, et al.
Published: (2026) -
On the Resilience of LLM-Based Multi-Agent Collaboration with Faulty Agents
by: Huang, Jen-tse, et al.
Published: (2024)