LEGO-Eval: Towards Fine-Grained Evaluation on Synthesizing 3D Embodied Environments with Tool Augmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Hwangbo, Gyeom, Chae, Hyungjoo, Kang, Minseok, Ju, Hyeonjong, Oh, Soohyun, Yeo, Jinyoung |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ToolHaystack: Stress-Testing Tool-Augmented Language Models in Realistic Long-Term Interactions
por: Kwak, Beong-woo, et al.
Publicado: (2025)
por: Kwak, Beong-woo, et al.
Publicado: (2025)
Evidence-Focused Fact Summarization for Knowledge-Augmented Zero-Shot Question Answering
por: Ko, Sungho, et al.
Publicado: (2024)
por: Ko, Sungho, et al.
Publicado: (2024)
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
por: Kim, Sunghwan, et al.
Publicado: (2025)
por: Kim, Sunghwan, et al.
Publicado: (2025)
VerifiNER: Verification-augmented NER via Knowledge-grounded Reasoning with Large Language Models
por: Kim, Seoyeon, et al.
Publicado: (2024)
por: Kim, Seoyeon, et al.
Publicado: (2024)
Evaluating Robustness of Reward Models for Mathematical Reasoning
por: Kim, Sunghwan, et al.
Publicado: (2024)
por: Kim, Sunghwan, et al.
Publicado: (2024)
Coffee-Gym: An Environment for Evaluating and Improving Natural Language Feedback on Erroneous Code
por: Chae, Hyungjoo, et al.
Publicado: (2024)
por: Chae, Hyungjoo, et al.
Publicado: (2024)
PairEval: Open-domain Dialogue Evaluation with Pairwise Comparison
por: Park, ChaeHun, et al.
Publicado: (2024)
por: Park, ChaeHun, et al.
Publicado: (2024)
Web-Shepherd: Advancing PRMs for Reinforcing Web Agents
por: Chae, Hyungjoo, et al.
Publicado: (2025)
por: Chae, Hyungjoo, et al.
Publicado: (2025)
Web Agents with World Models: Learning and Leveraging Environment Dynamics in Web Navigation
por: Chae, Hyungjoo, et al.
Publicado: (2024)
por: Chae, Hyungjoo, et al.
Publicado: (2024)
One Missing Piece for Open-Source Reasoning Models: A Dataset to Mitigate Cold-Starting Short CoT LLMs in RL
por: Chae, Hyungjoo, et al.
Publicado: (2025)
por: Chae, Hyungjoo, et al.
Publicado: (2025)
Towards Lifelong Dialogue Agents via Timeline-based Memory Management
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2024)
por: Ong, Kai Tzu-iunn, et al.
Publicado: (2024)
Coffee: Boost Your Code LLMs by Fixing Bugs with Feedback
por: Moon, Seungjun, et al.
Publicado: (2023)
por: Moon, Seungjun, et al.
Publicado: (2023)
Safe and Scalable Web Agent Learning via Recreated Websites
por: Chae, Hyungjoo, et al.
Publicado: (2026)
por: Chae, Hyungjoo, et al.
Publicado: (2026)
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
por: Huang, Haochen, et al.
Publicado: (2025)
por: Huang, Haochen, et al.
Publicado: (2025)
A2Eval: Agentic and Automated Evaluation for Embodied Brain
por: Zhang, Shuai, et al.
Publicado: (2026)
por: Zhang, Shuai, et al.
Publicado: (2026)
Do LLMs Have Distinct and Consistent Personality? TRAIT: Personality Testset designed for LLMs with Psychometrics
por: Lee, Seungbeen, et al.
Publicado: (2024)
por: Lee, Seungbeen, et al.
Publicado: (2024)
EmbodiedEval: Evaluate Multimodal LLMs as Embodied Agents
por: Cheng, Zhili, et al.
Publicado: (2025)
por: Cheng, Zhili, et al.
Publicado: (2025)
UniSumEval: Towards Unified, Fine-Grained, Multi-Dimensional Summarization Evaluation for LLMs
por: Lee, Yuho, et al.
Publicado: (2024)
por: Lee, Yuho, et al.
Publicado: (2024)
Language Models as Compilers: Simulating Pseudocode Execution Improves Algorithmic Reasoning in Language Models
por: Chae, Hyungjoo, et al.
Publicado: (2024)
por: Chae, Hyungjoo, et al.
Publicado: (2024)
PRINCIPLES: Synthetic Strategy Memory for Proactive Dialogue Agents
por: Kim, Namyoung, et al.
Publicado: (2025)
por: Kim, Namyoung, et al.
Publicado: (2025)
LRAGE: Legal Retrieval Augmented Generation Evaluation Tool
por: Park, Minhu, et al.
Publicado: (2025)
por: Park, Minhu, et al.
Publicado: (2025)
Designing Memory-Augmented AR Agents for Spatiotemporal Reasoning in Personalized Task Assistance
por: Choi, Dongwook, et al.
Publicado: (2025)
por: Choi, Dongwook, et al.
Publicado: (2025)
Unveiling Implicit Table Knowledge with Question-Then-Pinpoint Reasoner for Insightful Table Summarization
por: Seo, Kwangwook, et al.
Publicado: (2024)
por: Seo, Kwangwook, et al.
Publicado: (2024)
Fast and Fluent Diffusion Language Models via Convolutional Decoding and Rejective Fine-tuning
por: Seo, Yeongbin, et al.
Publicado: (2025)
por: Seo, Yeongbin, et al.
Publicado: (2025)
Cactus: Towards Psychological Counseling Conversations using Cognitive Behavioral Theory
por: Lee, Suyeon, et al.
Publicado: (2024)
por: Lee, Suyeon, et al.
Publicado: (2024)
PAC-BENCH: Evaluating Multi-Agent Collaboration under Privacy Constraints
por: Park, Minjun, et al.
Publicado: (2026)
por: Park, Minjun, et al.
Publicado: (2026)
EMBGuard: Constructing Hazard-Aware Guardrails for Safe Planning in Embodied Agents
por: Choi, Dongwook, et al.
Publicado: (2026)
por: Choi, Dongwook, et al.
Publicado: (2026)
Is Functional Correctness Enough to Evaluate Code Language Models? Exploring Diversity of Generated Codes
por: Chon, Heejae, et al.
Publicado: (2024)
por: Chon, Heejae, et al.
Publicado: (2024)
FINEST: Improving LLM Responses to Sensitive Topics Through Fine-Grained Evaluation
por: Oh, Juhyun, et al.
Publicado: (2026)
por: Oh, Juhyun, et al.
Publicado: (2026)
Embodied Agents Meet Personalization: Investigating Challenges and Solutions Through the Lens of Memory Utilization
por: Kwon, Taeyoon, et al.
Publicado: (2025)
por: Kwon, Taeyoon, et al.
Publicado: (2025)
KPEval: Towards Fine-Grained Semantic-Based Keyphrase Evaluation
por: Wu, Di, et al.
Publicado: (2023)
por: Wu, Di, et al.
Publicado: (2023)
HausaNLP at SemEval-2025 Task 3: Towards a Fine-Grained Model-Aware Hallucination Detection
por: Bala, Maryam, et al.
Publicado: (2025)
por: Bala, Maryam, et al.
Publicado: (2025)
Train-Attention: Meta-Learning Where to Focus in Continual Knowledge Learning
por: Seo, Yeongbin, et al.
Publicado: (2024)
por: Seo, Yeongbin, et al.
Publicado: (2024)
Quantifying Genuine Awareness in Hallucination Prediction Beyond Question-Side Shortcuts
por: Seo, Yeongbin, et al.
Publicado: (2025)
por: Seo, Yeongbin, et al.
Publicado: (2025)
Generative Subgraph Retrieval for Knowledge Graph-Grounded Dialog Generation
por: Park, Jinyoung, et al.
Publicado: (2024)
por: Park, Jinyoung, et al.
Publicado: (2024)
BatchEval: Towards Human-like Text Evaluation
por: Yuan, Peiwen, et al.
Publicado: (2023)
por: Yuan, Peiwen, et al.
Publicado: (2023)
ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios
por: Ye, Junjie, et al.
Publicado: (2024)
por: Ye, Junjie, et al.
Publicado: (2024)
Breaking Chains: Unraveling the Links in Multi-Hop Knowledge Unlearning
por: Choi, Minseok, et al.
Publicado: (2024)
por: Choi, Minseok, et al.
Publicado: (2024)
T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step
por: Chen, Zehui, et al.
Publicado: (2023)
por: Chen, Zehui, et al.
Publicado: (2023)
Self-Consistent Reasoning-based Aspect-Sentiment Quad Prediction with Extract-Then-Assign Strategy
por: Kim, Jieyong, et al.
Publicado: (2024)
por: Kim, Jieyong, et al.
Publicado: (2024)
Ejemplares similares
-
ToolHaystack: Stress-Testing Tool-Augmented Language Models in Realistic Long-Term Interactions
por: Kwak, Beong-woo, et al.
Publicado: (2025) -
Evidence-Focused Fact Summarization for Knowledge-Augmented Zero-Shot Question Answering
por: Ko, Sungho, et al.
Publicado: (2024) -
Rethinking Reward Model Evaluation Through the Lens of Reward Overoptimization
por: Kim, Sunghwan, et al.
Publicado: (2025) -
VerifiNER: Verification-augmented NER via Knowledge-grounded Reasoning with Large Language Models
por: Kim, Seoyeon, et al.
Publicado: (2024) -
Evaluating Robustness of Reward Models for Mathematical Reasoning
por: Kim, Sunghwan, et al.
Publicado: (2024)