Coffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Code
Fuente:
arXiv
Guardado en:
| Autores principales: | Chae, Hyungjoo, Kwon, Taeyoon, Moon, Seungjun, Song, Yongho, Kang, Dongjin, Ong, Kai Tzu-iunn, Kwak, Beong-woo, Bae, Seonghyeon, Hwang, Seung-won, Yeo, Jinyoung |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Coffee: Boost Your Code LLMs by Fixing Bugs with Feedback
por: Moon, Seungjun, et al.
Publicado: (2023)
por: Moon, Seungjun, et al.
Publicado: (2023)
Large Language Models Are Self-Taught Reasoners: Enhancing LLM Applications via Tailored Problem-Solving Demonstrations
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2024)
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2024)
Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language Models
por: Chae, Hyungjoo, et al.
Publicado: (2024)
por: Chae, Hyungjoo, et al.
Publicado: (2024)
Towards Lifelong Dialogue Agents via Timeline-based Memory Management
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2024)
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2024)
ToolHaystack: Stress-Testing Tool-Augmented Language Models in Realistic Long-Term Interactions
por: Kwak, Beong-woo, et al.
Publicado: (2025)
por: Kwak, Beong-woo, et al.
Publicado: (2025)
Embodied Agents Meet Personalization: Investigating Challenges and Solutions Through the Lens of Memory Utilization
por: Kwon, Taeyoon, et al.
Publicado: (2025)
por: Kwon, Taeyoon, et al.
Publicado: (2025)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
por: Kim, Sunghwan, et al.
Publicado: (2025)
por: Kim, Sunghwan, et al.
Publicado: (2025)
Large Language Models are Clinical Reasoners: Reasoning-Aware Diagnosis Framework with Prompt-Generated Rationales
por: Kwon, Taeyoon, et al.
Publicado: (2023)
por: Kwon, Taeyoon, et al.
Publicado: (2023)
One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL
por: Chae, Hyungjoo, et al.
Publicado: (2025)
por: Chae, Hyungjoo, et al.
Publicado: (2025)
Evaluating Robustness of Reward Models for Mathematical Reasoning
por: Kim, Sunghwan, et al.
Publicado: (2024)
por: Kim, Sunghwan, et al.
Publicado: (2024)
On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length
por: Kim, Sunghwan, et al.
Publicado: (2026)
por: Kim, Sunghwan, et al.
Publicado: (2026)
Can Large Language Models be Good Emotional Supporter? Mitigating Preference Bias on Emotional Support Conversation
por: Kang, Dongjin, et al.
Publicado: (2024)
por: Kang, Dongjin, et al.
Publicado: (2024)
Web-Shepherd: Advancing PRMs for Reinforcing Web Agents
por: Chae, Hyungjoo, et al.
Publicado: (2025)
por: Chae, Hyungjoo, et al.
Publicado: (2025)
Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web Navigation
por: Chae, Hyungjoo, et al.
Publicado: (2024)
por: Chae, Hyungjoo, et al.
Publicado: (2024)
Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with Psychometrics
por: Lee, Seungbeen, et al.
Publicado: (2024)
por: Lee, Seungbeen, et al.
Publicado: (2024)
Commonsense-augmented Memory Construction and Management in Long-term Conversations via Context-aware Persona Refinement
por: Kim, Hana, et al.
Publicado: (2024)
por: Kim, Hana, et al.
Publicado: (2024)
LLM Meets Scene Graph: Can Large Language Models Understand and Generate Scene Graphs? A Benchmark and Empirical Study
por: Yang, Dongil, et al.
Publicado: (2025)
por: Yang, Dongil, et al.
Publicado: (2025)
Can You Share Your Story? Modeling Clients' Metacognition and Openness for LLM Therapist Evaluation
por: Kim, Minju, et al.
Publicado: (2025)
por: Kim, Minju, et al.
Publicado: (2025)
SAFE: Stepwise Atomic Feedback for Error correction in Multi-hop Reasoning
por: Kwon, Daeyong, et al.
Publicado: (2026)
por: Kwon, Daeyong, et al.
Publicado: (2026)
VerifiNER: Verification-augmented NER via Knowledge-grounded Reasoning with Large Language Models
por: Kim, Seoyeon, et al.
Publicado: (2024)
por: Kim, Seoyeon, et al.
Publicado: (2024)
Evidence-Focused Fact Summarization for Knowledge-Augmented Zero-Shot Question Answering
por: Ko, Sungho, et al.
Publicado: (2024)
por: Ko, Sungho, et al.
Publicado: (2024)
PRINCIPLES: Synthetic Strategy Memory for Proactive Dialogue Agents
por: Kim, Namyoung, et al.
Publicado: (2025)
por: Kim, Namyoung, et al.
Publicado: (2025)
Towards Direct Evaluation of Harness Optimizers via Priority Ranking
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2026)
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2026)
CREFT: Sequential Multi-Agent LLM for Character Relation Extraction
por: Chun, Ye Eun, et al.
Publicado: (2025)
por: Chun, Ye Eun, et al.
Publicado: (2025)
Chain of Grounded Objectives: Bridging Process and Goal-oriented Prompting for Code Generation
por: Yeo, Sangyeop, et al.
Publicado: (2025)
por: Yeo, Sangyeop, et al.
Publicado: (2025)
On Listwise Reranking for Corpus Feedback
por: Yoon, Soyoung, et al.
Publicado: (2025)
por: Yoon, Soyoung, et al.
Publicado: (2025)
Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance
por: Choi, Dongwook, et al.
Publicado: (2025)
por: Choi, Dongwook, et al.
Publicado: (2025)
LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation
por: Hwangbo, Gyeom, et al.
Publicado: (2025)
por: Hwangbo, Gyeom, et al.
Publicado: (2025)
Evidentiality-aware Retrieval for Overcoming Abstractiveness in Open-Domain Question Answering
por: Song, Yongho, et al.
Publicado: (2023)
por: Song, Yongho, et al.
Publicado: (2023)
Pearl: A Review-driven Persona-Knowledge Grounded Conversational Recommendation Dataset
por: Kim, Minjin, et al.
Publicado: (2024)
por: Kim, Minjin, et al.
Publicado: (2024)
Ever-Evolving Memory by Blending and Refining the Past
por: Kim, Seo Hyun, et al.
Publicado: (2024)
por: Kim, Seo Hyun, et al.
Publicado: (2024)
Is Functional Correctness Enough to Evaluate Code Language Models? Exploring Diversity of Generated Codes
por: Chon, Heejae, et al.
Publicado: (2024)
por: Chon, Heejae, et al.
Publicado: (2024)
ConvCodeWorld: Benchmarking Conversational Code Generation in Reproducible Feedback Environments
por: Han, Hojae, et al.
Publicado: (2025)
por: Han, Hojae, et al.
Publicado: (2025)
Counterfactual-Consistency Prompting for Relative Temporal Understanding in Large Language Models
por: Kim, Jongho, et al.
Publicado: (2025)
por: Kim, Jongho, et al.
Publicado: (2025)
Dual-Scale World Models for LLM Agents Towards Hard-Exploration Problems
por: Kim, Minsoo, et al.
Publicado: (2025)
por: Kim, Minsoo, et al.
Publicado: (2025)
HARP: Hesitation-Aware Reframing in Transformer Inference Pass
por: Storaï, Romain, et al.
Publicado: (2024)
por: Storaï, Romain, et al.
Publicado: (2024)
CoEx -- Co-evolving World-model and Exploration
por: Kim, Minsoo, et al.
Publicado: (2025)
por: Kim, Minsoo, et al.
Publicado: (2025)
UnIte: Uncertainty-based Iterative Document Sampling for Domain Adaptation in Information Retrieval
por: Kim, Jongyoon, et al.
Publicado: (2026)
por: Kim, Jongyoon, et al.
Publicado: (2026)
EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents
por: Choi, Dongwook, et al.
Publicado: (2026)
por: Choi, Dongwook, et al.
Publicado: (2026)
PAC-BENCH: Evaluating Multi-Agent Collaboration under Privacy Constraints
por: Park, Minjun, et al.
Publicado: (2026)
por: Park, Minjun, et al.
Publicado: (2026)
Ejemplares similares
-
Coffee: Boost Your Code LLMs by Fixing Bugs with Feedback
por: Moon, Seungjun, et al.
Publicado: (2023) -
Large Language Models Are Self-Taught Reasoners: Enhancing LLM Applications via Tailored Problem-Solving Demonstrations
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2024) -
Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language Models
por: Chae, Hyungjoo, et al.
Publicado: (2024) -
Towards Lifelong Dialogue Agents via Timeline-based Memory Management
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2024) -
ToolHaystack: Stress-Testing Tool-Augmented Language Models in Realistic Long-Term Interactions
por: Kwak, Beong-woo, et al.
Publicado: (2025)