ProgCo: Program Helps Self-Correction of Large Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Song, Xiaoshuai, Wu, Yanan, Wang, Weixun, Liu, Jiaheng, Su, Wenbo, Zheng, Bo |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
di: Wu, Yanan, et al.
Pubblicazione: (2024)
di: Wu, Yanan, et al.
Pubblicazione: (2024)
ProgRM: Build Better GUI Agents with Progress Rewards
di: Zhang, Danyang, et al.
Pubblicazione: (2025)
di: Zhang, Danyang, et al.
Pubblicazione: (2025)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
di: Li, Shilong, et al.
Pubblicazione: (2024)
di: Li, Shilong, et al.
Pubblicazione: (2024)
Think-J: Learning to Think for Generative LLM-as-a-Judge
di: Huang, Hui, et al.
Pubblicazione: (2025)
di: Huang, Hui, et al.
Pubblicazione: (2025)
Knowledge Editing on Black-box Large Language Models
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models
di: Tsui, Ken
Pubblicazione: (2025)
di: Tsui, Ken
Pubblicazione: (2025)
Deconstructing Long Chain-of-Thought: A Structured Reasoning Optimization Framework for Long CoT Distillation
di: Luo, Yijia, et al.
Pubblicazione: (2025)
di: Luo, Yijia, et al.
Pubblicazione: (2025)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
di: Tan, Yingshui, et al.
Pubblicazione: (2024)
FAS: Fast ANN-SNN Conversion for Spiking Large Language Models
di: Chen, Long, et al.
Pubblicazione: (2025)
di: Chen, Long, et al.
Pubblicazione: (2025)
Synthesizing and Adapting Error Correction Data for Mobile Large Language Model Applications
di: Zhang, Yanxiang, et al.
Pubblicazione: (2025)
di: Zhang, Yanxiang, et al.
Pubblicazione: (2025)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
di: Bai, Ge, et al.
Pubblicazione: (2024)
di: Bai, Ge, et al.
Pubblicazione: (2024)
APPL: A Prompt Programming Language for Harmonious Integration of Programs and Large Language Model Prompts
di: Dong, Honghua, et al.
Pubblicazione: (2024)
di: Dong, Honghua, et al.
Pubblicazione: (2024)
How do Large Language Models Navigate Conflicts between Honesty and Helpfulness?
di: Liu, Ryan, et al.
Pubblicazione: (2024)
di: Liu, Ryan, et al.
Pubblicazione: (2024)
Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
di: Tan, Yingshui, et al.
Pubblicazione: (2025)
di: Tan, Yingshui, et al.
Pubblicazione: (2025)
Emulated Disalignment: Safety Alignment for Large Language Models May Backfire!
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
di: Zhou, Zhanhui, et al.
Pubblicazione: (2024)
RAVR: Reference-Answer-guided Variational Reasoning for Large Language Models
di: Lin, Tianqianjin, et al.
Pubblicazione: (2025)
di: Lin, Tianqianjin, et al.
Pubblicazione: (2025)
SSR: Socratic Self-Refine for Large Language Model Reasoning
di: Shi, Haizhou, et al.
Pubblicazione: (2025)
di: Shi, Haizhou, et al.
Pubblicazione: (2025)
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
di: Li, Shilong, et al.
Pubblicazione: (2024)
di: Li, Shilong, et al.
Pubblicazione: (2024)
Large Language Models Cannot Self-Correct Reasoning Yet
di: Huang, Jie, et al.
Pubblicazione: (2023)
di: Huang, Jie, et al.
Pubblicazione: (2023)
Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
di: Yang, Jinluan, et al.
Pubblicazione: (2025)
Fourier Head: Helping Large Language Models Learn Complex Probability Distributions
di: Gillman, Nate, et al.
Pubblicazione: (2024)
di: Gillman, Nate, et al.
Pubblicazione: (2024)
Characterizing Large Language Model Geometry Helps Solve Toxicity Detection and Generation
di: Balestriero, Randall, et al.
Pubblicazione: (2023)
di: Balestriero, Randall, et al.
Pubblicazione: (2023)
Importance Weighting Can Help Large Language Models Self-Improve
di: Jiang, Chunyang, et al.
Pubblicazione: (2024)
di: Jiang, Chunyang, et al.
Pubblicazione: (2024)
CyberCorrect: A Cybernetic Framework for Closed-Loop Self-Correction in Large Language Models
di: Wu, Yuning, et al.
Pubblicazione: (2026)
di: Wu, Yuning, et al.
Pubblicazione: (2026)
E^2-LLM: Efficient and Extreme Length Extension of Large Language Models
di: Liu, Jiaheng, et al.
Pubblicazione: (2024)
di: Liu, Jiaheng, et al.
Pubblicazione: (2024)
Scalable Best-of-N Selection for Large Language Models via Self-Certainty
di: Kang, Zhewei, et al.
Pubblicazione: (2025)
di: Kang, Zhewei, et al.
Pubblicazione: (2025)
Fine-tuning can Help Detect Pretraining Data from Large Language Models
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
di: Zhang, Hengxiang, et al.
Pubblicazione: (2024)
Query-Conditioned Test-Time Self-Training for Large Language Models
di: Song, Chaehee, et al.
Pubblicazione: (2026)
di: Song, Chaehee, et al.
Pubblicazione: (2026)
Adaptive Pruning for Large Language Models with Structural Importance Awareness
di: Zheng, Haotian, et al.
Pubblicazione: (2024)
di: Zheng, Haotian, et al.
Pubblicazione: (2024)
Self-Evolving Critique Abilities in Large Language Models
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
di: Tang, Zhengyang, et al.
Pubblicazione: (2025)
How to inject knowledge efficiently? Knowledge Infusion Scaling Law for Pre-training Large Language Models
di: Lv, Kangtao, et al.
Pubblicazione: (2025)
di: Lv, Kangtao, et al.
Pubblicazione: (2025)
GRATH: Gradual Self-Truthifying for Large Language Models
di: Chen, Weixin, et al.
Pubblicazione: (2024)
di: Chen, Weixin, et al.
Pubblicazione: (2024)
CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback
di: Zhang, Wenbo, et al.
Pubblicazione: (2024)
di: Zhang, Wenbo, et al.
Pubblicazione: (2024)
ZeroUnlearn: Few-Shot Knowledge Unlearning in Large Language Models
di: Lin, Yujie, et al.
Pubblicazione: (2026)
di: Lin, Yujie, et al.
Pubblicazione: (2026)
Self-Rewarding PPO: Aligning Large Language Models with Demonstrations Only
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
di: Zhang, Qingru, et al.
Pubblicazione: (2025)
Sparse is Enough in Fine-tuning Pre-trained Large Language Models
di: Song, Weixi, et al.
Pubblicazione: (2023)
di: Song, Weixi, et al.
Pubblicazione: (2023)
SelfCite: Self-Supervised Alignment for Context Attribution in Large Language Models
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2025)
di: Chuang, Yung-Sung, et al.
Pubblicazione: (2025)
Causality for Large Language Models
di: Wu, Anpeng, et al.
Pubblicazione: (2024)
di: Wu, Anpeng, et al.
Pubblicazione: (2024)
CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)
Program Semantic Inequivalence Game with Large Language Models
di: Miceli-Barone, Antonio Valerio, et al.
Pubblicazione: (2025)
di: Miceli-Barone, Antonio Valerio, et al.
Pubblicazione: (2025)
Documenti analoghi
-
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
di: Wu, Yanan, et al.
Pubblicazione: (2024) -
ProgRM: Build Better GUI Agents with Progress Rewards
di: Zhang, Danyang, et al.
Pubblicazione: (2025) -
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
di: Li, Shilong, et al.
Pubblicazione: (2024) -
Think-J: Learning to Think for Generative LLM-as-a-Judge
di: Huang, Hui, et al.
Pubblicazione: (2025) -
Knowledge Editing on Black-box Large Language Models
di: Song, Xiaoshuai, et al.
Pubblicazione: (2024)