Text2World: Benchmarking Large Language Models for Symbolic World Model Generation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Hu, Mengkang, Chen, Tianxing, Zou, Yude, Lei, Yuheng, Chen, Qiguang, Li, Ming, Mu, Yao, Zhang, Hongyuan, Shao, Wenqi, Luo, Ping |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2025
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
von: Hu, Mengkang, et al.
Veröffentlicht: (2024)
von: Hu, Mengkang, et al.
Veröffentlicht: (2024)
Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
von: Hu, Mengkang, et al.
Veröffentlicht: (2025)
von: Hu, Mengkang, et al.
Veröffentlicht: (2025)
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
von: Hu, Mengkang, et al.
Veröffentlicht: (2023)
von: Hu, Mengkang, et al.
Veröffentlicht: (2023)
Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
von: Yang, Yue, et al.
Veröffentlicht: (2025)
von: Yang, Yue, et al.
Veröffentlicht: (2025)
RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins (early version)
von: Mu, Yao, et al.
Veröffentlicht: (2024)
von: Mu, Yao, et al.
Veröffentlicht: (2024)
OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis
von: Chen, Junting, et al.
Veröffentlicht: (2025)
von: Chen, Junting, et al.
Veröffentlicht: (2025)
Electronic Circuit Principles of Large Language Models
von: Chen, Qiguang, et al.
Veröffentlicht: (2025)
von: Chen, Qiguang, et al.
Veröffentlicht: (2025)
X-WebAgentBench: A Multilingual Interactive Web Benchmark for Evaluating Global Agentic System
von: Wang, Peng, et al.
Veröffentlicht: (2025)
von: Wang, Peng, et al.
Veröffentlicht: (2025)
RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins
von: Mu, Yao, et al.
Veröffentlicht: (2025)
von: Mu, Yao, et al.
Veröffentlicht: (2025)
InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement
von: Zou, Yude, et al.
Veröffentlicht: (2026)
von: Zou, Yude, et al.
Veröffentlicht: (2026)
Generating Symbolic World Models via Test-time Scaling of Large Language Models
von: Yu, Zhouliang, et al.
Veröffentlicht: (2025)
von: Yu, Zhouliang, et al.
Veröffentlicht: (2025)
PrefixQuant: Eliminating Outliers by Prefixed Tokens for Large Language Models Quantization
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models
von: Chen, Qiguang, et al.
Veröffentlicht: (2025)
von: Chen, Qiguang, et al.
Veröffentlicht: (2025)
G3Flow: Generative 3D Semantic Flow for Pose-aware and Generalizable Object Manipulation
von: Chen, Tianxing, et al.
Veröffentlicht: (2024)
von: Chen, Tianxing, et al.
Veröffentlicht: (2024)
Differences in Text Generated by Diffusion and Autoregressive Language Models
von: Zhang, Zeyang, et al.
Veröffentlicht: (2026)
von: Zhang, Zeyang, et al.
Veröffentlicht: (2026)
Forensics-Bench: A Comprehensive Forgery Detection Benchmark Suite for Large Vision Language Models
von: Wang, Jin, et al.
Veröffentlicht: (2025)
von: Wang, Jin, et al.
Veröffentlicht: (2025)
VPWEM: Non-Markovian Visuomotor Policy with Working and Episodic Memory
von: Lei, Yuheng, et al.
Veröffentlicht: (2026)
von: Lei, Yuheng, et al.
Veröffentlicht: (2026)
From Word to World: Can Large Language Models be Implicit Text-based World Models?
von: Li, Yixia, et al.
Veröffentlicht: (2025)
von: Li, Yixia, et al.
Veröffentlicht: (2025)
Language-Augmented Symbolic Planner for Open-World Task Planning
von: Chen, Guanqi, et al.
Veröffentlicht: (2024)
von: Chen, Guanqi, et al.
Veröffentlicht: (2024)
OWL: Optimized Workforce Learning for General Multi-Agent Assistance in Real-World Task Automation
von: Hu, Mengkang, et al.
Veröffentlicht: (2025)
von: Hu, Mengkang, et al.
Veröffentlicht: (2025)
Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
von: Meng, Fanqing, et al.
Veröffentlicht: (2024)
von: Meng, Fanqing, et al.
Veröffentlicht: (2024)
HyCodePolicy: Hybrid Language Controllers for Multimodal Monitoring and Decision in Embodied Agents
von: Liu, Yibin, et al.
Veröffentlicht: (2025)
von: Liu, Yibin, et al.
Veröffentlicht: (2025)
AgentStealth: Reinforcing Large Language Model for Anonymizing User-generated Text
von: Shao, Chenyang, et al.
Veröffentlicht: (2025)
von: Shao, Chenyang, et al.
Veröffentlicht: (2025)
AgentGen: Enhancing Planning Abilities for Large Language Model based Agent via Environment and Task Generation
von: Hu, Mengkang, et al.
Veröffentlicht: (2024)
von: Hu, Mengkang, et al.
Veröffentlicht: (2024)
DexHandDiff: Interaction-aware Diffusion Planning for Adaptive Dexterous Manipulation
von: Liang, Zhixuan, et al.
Veröffentlicht: (2024)
von: Liang, Zhixuan, et al.
Veröffentlicht: (2024)
TESTEVAL: Benchmarking Large Language Models for Test Case Generation
von: Wang, Wenhan, et al.
Veröffentlicht: (2024)
von: Wang, Wenhan, et al.
Veröffentlicht: (2024)
DiffAgent: Fast and Accurate Text-to-Image API Selection with Large Language Model
von: Zhao, Lirui, et al.
Veröffentlicht: (2024)
von: Zhao, Lirui, et al.
Veröffentlicht: (2024)
EfficientQAT: Efficient Quantization-Aware Training for Large Language Models
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
von: Chen, Mengzhao, et al.
Veröffentlicht: (2024)
Simulating Field Experiments with Large Language Models
von: Chen, Yaoyu, et al.
Veröffentlicht: (2024)
von: Chen, Yaoyu, et al.
Veröffentlicht: (2024)
Predicting Field Experiments with Large Language Models
von: Chen, Yaoyu, et al.
Veröffentlicht: (2025)
von: Chen, Yaoyu, et al.
Veröffentlicht: (2025)
Adaptive Text Watermark for Large Language Models
von: Liu, Yepeng, et al.
Veröffentlicht: (2024)
von: Liu, Yepeng, et al.
Veröffentlicht: (2024)
MPCC: A Novel Benchmark for Multimodal Planning with Complex Constraints in Multimodal Large Language Models
von: Ji, Yiyan, et al.
Veröffentlicht: (2025)
von: Ji, Yiyan, et al.
Veröffentlicht: (2025)
KoLA: Carefully Benchmarking World Knowledge of Large Language Models
von: Yu, Jifan, et al.
Veröffentlicht: (2023)
von: Yu, Jifan, et al.
Veröffentlicht: (2023)
PhyBench: A Physical Commonsense Benchmark for Evaluating Text-to-Image Models
von: Meng, Fanqing, et al.
Veröffentlicht: (2024)
von: Meng, Fanqing, et al.
Veröffentlicht: (2024)
An Investigation of Large Language Models for Real-World Hate Speech Detection
von: Guo, Keyan, et al.
Veröffentlicht: (2024)
von: Guo, Keyan, et al.
Veröffentlicht: (2024)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
von: Zhang, Daoan, et al.
Veröffentlicht: (2025)
von: Zhang, Daoan, et al.
Veröffentlicht: (2025)
Enhance Sample Efficiency and Robustness of End-to-end Urban Autonomous Driving via Semantic Masked World Model
von: Gao, Zeyu, et al.
Veröffentlicht: (2022)
von: Gao, Zeyu, et al.
Veröffentlicht: (2022)
LatticeWorld: A Multimodal Large Language Model-Empowered Framework for Interactive Complex World Generation
von: Duan, Yinglin, et al.
Veröffentlicht: (2025)
von: Duan, Yinglin, et al.
Veröffentlicht: (2025)
EMOS: Embodiment-aware Heterogeneous Multi-robot Operating System with LLM Agents
von: Chen, Junting, et al.
Veröffentlicht: (2024)
von: Chen, Junting, et al.
Veröffentlicht: (2024)
The Mental World of Large Language Models in Recommendation: A Benchmark on Association, Personalization, and Knowledgeability
von: Hu, Guangneng
Veröffentlicht: (2025)
von: Hu, Guangneng
Veröffentlicht: (2025)
Ähnliche Einträge
-
HiAgent: Hierarchical Working Memory Management for Solving Long-Horizon Agent Tasks with Large Language Model
von: Hu, Mengkang, et al.
Veröffentlicht: (2024) -
Agent2World: Learning to Generate Symbolic World Models via Adaptive Multi-Agent Feedback
von: Hu, Mengkang, et al.
Veröffentlicht: (2025) -
Tree-Planner: Efficient Close-loop Task Planning with Large Language Models
von: Hu, Mengkang, et al.
Veröffentlicht: (2023) -
Truly Assessing Fluid Intelligence of Large Language Models through Dynamic Reasoning Evaluation
von: Yang, Yue, et al.
Veröffentlicht: (2025) -
RoboTwin: Dual-Arm Robot Benchmark with Generative Digital Twins (early version)
von: Mu, Yao, et al.
Veröffentlicht: (2024)