PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Xie, Tianyidan, Wang, Peiyu, Qian, Yuyi, Wang, Yuxuan, Ma, Rui, Tai, Ying, Wu, Song, Wang, Qian, Wang, Lanjun, Yi, Zili |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Anywhere: A Multi-Agent Framework for User-Guided, Reliable, and Diverse Foreground-Conditioned Image Generation
par: Xie, Tianyidan, et autres
Publié: (2024)
par: Xie, Tianyidan, et autres
Publié: (2024)
PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics
par: Xie, Tianyidan, et autres
Publié: (2026)
par: Xie, Tianyidan, et autres
Publié: (2026)
Efficient Turing Machine Simulation with Transformers
par: Li, Qian, et autres
Publié: (2025)
par: Li, Qian, et autres
Publié: (2025)
DP-Adapter: Dual-Pathway Adapter for Boosting Fidelity and Text Consistency in Customizable Human Image Generation
par: Wang, Ye, et autres
Publié: (2025)
par: Wang, Ye, et autres
Publié: (2025)
A training-free framework for high-fidelity appearance transfer via diffusion transformers
par: Gu, Shengrong, et autres
Publié: (2026)
par: Gu, Shengrong, et autres
Publié: (2026)
CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration
par: Xie, Tianyidan, et autres
Publié: (2026)
par: Xie, Tianyidan, et autres
Publié: (2026)
Constant Bit-size Transformers Are Turing Complete
par: Li, Qian, et autres
Publié: (2025)
par: Li, Qian, et autres
Publié: (2025)
SE-GA: Memory-Augmented Self-Evolution for GUI Agents
par: Jin, Shilong, et autres
Publié: (2026)
par: Jin, Shilong, et autres
Publié: (2026)
When Planning Fails Despite Correct Execution: On Epistemic Calibration for LLM-Based Multi-Agent Systems
par: Wang, Zehao, et autres
Publié: (2026)
par: Wang, Zehao, et autres
Publié: (2026)
Learning Concept-Based Causal Transition and Symbolic Reasoning for Visual Planning
par: Qian, Yilue, et autres
Publié: (2023)
par: Qian, Yilue, et autres
Publié: (2023)
Key Decision-Makers in Multi-Agent Debates: Who Holds the Power?
par: Zhang, Qian, et autres
Publié: (2025)
par: Zhang, Qian, et autres
Publié: (2025)
Region-Aware Text-to-Image Generation via Hard Binding and Soft Refinement
par: Chen, Zhennan, et autres
Publié: (2024)
par: Chen, Zhennan, et autres
Publié: (2024)
SimuScene: Training and Benchmarking Code Generation to Simulate Physical Scenarios
par: Wang, Yanan, et autres
Publié: (2026)
par: Wang, Yanan, et autres
Publié: (2026)
A Simple Distributed Algorithm for Sparse Fractional Covering and Packing Problems
par: Li, Qian, et autres
Publié: (2024)
par: Li, Qian, et autres
Publié: (2024)
BilliardPhys-Bench: Benchmarking Physical Reasoning and Visual Dynamics of Multimodal LLMs
par: Wang, Ben, et autres
Publié: (2026)
par: Wang, Ben, et autres
Publié: (2026)
NK-GAD: Neighbor Knowledge-Enhanced Unsupervised Graph Anomaly Detection
par: Wang, Zehao, et autres
Publié: (2026)
par: Wang, Zehao, et autres
Publié: (2026)
Reasoning-targeted Jailbreak Attacks on Large Reasoning Models via Semantic Triggers and Psychological Framing
par: Wang, Zehao, et autres
Publié: (2026)
par: Wang, Zehao, et autres
Publié: (2026)
ContractBench: Can LLM Agents Preserve Observation Contracts?
par: Wang, Jicheng, et autres
Publié: (2026)
par: Wang, Jicheng, et autres
Publié: (2026)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
par: Chow, Wei, et autres
Publié: (2025)
par: Chow, Wei, et autres
Publié: (2025)
Symbolic Execution for Quantum Error Correction Programs
par: Fang, Wang, et autres
Publié: (2023)
par: Fang, Wang, et autres
Publié: (2023)
PhysToolBench: Benchmarking Physical Tool Understanding for MLLMs
par: Zhang, Zixin, et autres
Publié: (2025)
par: Zhang, Zixin, et autres
Publié: (2025)
CodeFlowBench: A Multi-turn, Iterative Benchmark for Complex Code Generation
par: Wang, Sizhe, et autres
Publié: (2025)
par: Wang, Sizhe, et autres
Publié: (2025)
Manydepth2: Motion-Aware Self-Supervised Monocular Depth Estimation in Dynamic Scenes
par: Zhou, Kaichen, et autres
Publié: (2023)
par: Zhou, Kaichen, et autres
Publié: (2023)
RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding
par: Liu, Xiyan, et autres
Publié: (2025)
par: Liu, Xiyan, et autres
Publié: (2025)
ResearchEnvBench: Benchmarking Agents on Environment Synthesis for Research Code Execution
par: Wang, Yubang, et autres
Publié: (2026)
par: Wang, Yubang, et autres
Publié: (2026)
SimInsert: Seamless Video Object Insertion via Regional Sparse Attention Fusion
par: Chen, Xinyu, et autres
Publié: (2026)
par: Chen, Xinyu, et autres
Publié: (2026)
ORLoopBench: Solver-in-the-Loop Benchmarks for Self-Correction and Behavioral Rationality in Operations Research
par: Ao, Ruicheng, et autres
Publié: (2026)
par: Ao, Ruicheng, et autres
Publié: (2026)
PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level
par: Wang, Lintao, et autres
Publié: (2025)
par: Wang, Lintao, et autres
Publié: (2025)
Enhancing the Medical Context-Awareness Ability of LLMs via Multifaceted Self-Refinement Learning
par: Zhou, Yuxuan, et autres
Publié: (2025)
par: Zhou, Yuxuan, et autres
Publié: (2025)
ContextBench: A Benchmark for Context Retrieval in Coding Agents
par: Li, Han, et autres
Publié: (2026)
par: Li, Han, et autres
Publié: (2026)
TSI-Bench: Benchmarking Time Series Imputation
par: Du, Wenjie, et autres
Publié: (2024)
par: Du, Wenjie, et autres
Publié: (2024)
TransBench: Benchmarking Machine Translation for Industrial-Scale Applications
par: Li, Haijun, et autres
Publié: (2025)
par: Li, Haijun, et autres
Publié: (2025)
On the Expressive Power and Limitations of Multi-Layer SSMs
par: Zubić, Nikola, et autres
Publié: (2026)
par: Zubić, Nikola, et autres
Publié: (2026)
Solving No-wait Scheduling for Time-Sensitive Networks with Daisy-Chain Topology
par: Li, Qian, et autres
Publié: (2026)
par: Li, Qian, et autres
Publié: (2026)
LiveLongBench: Tackling Long-Context Understanding for Spoken Texts from Live Streams
par: Wu, Yongxuan, et autres
Publié: (2025)
par: Wu, Yongxuan, et autres
Publié: (2025)
MMDG-Bench: A Benchmark for Multimodal Domain Generalization
par: Zhan, Qianshan, et autres
Publié: (2026)
par: Zhan, Qianshan, et autres
Publié: (2026)
FeatureBench: Benchmarking Agentic Coding for Complex Feature Development
par: Zhou, Qixing, et autres
Publié: (2026)
par: Zhou, Qixing, et autres
Publié: (2026)
AInsteinBench: Benchmarking Coding Agents on Scientific Repositories
par: Duston, Titouan, et autres
Publié: (2025)
par: Duston, Titouan, et autres
Publié: (2025)
EvoCodeBench: A Human-Performance Benchmark for Self-Evolving LLM-Driven Coding Systems
par: Zhang, Wentao, et autres
Publié: (2026)
par: Zhang, Wentao, et autres
Publié: (2026)
SPA-Bench: A Comprehensive Benchmark for SmartPhone Agent Evaluation
par: Chen, Jingxuan, et autres
Publié: (2024)
par: Chen, Jingxuan, et autres
Publié: (2024)
Documents similaires
-
Anywhere: A Multi-Agent Framework for User-Guided, Reliable, and Diverse Foreground-Conditioned Image Generation
par: Xie, Tianyidan, et autres
Publié: (2024) -
PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics
par: Xie, Tianyidan, et autres
Publié: (2026) -
Efficient Turing Machine Simulation with Transformers
par: Li, Qian, et autres
Publié: (2025) -
DP-Adapter: Dual-Pathway Adapter for Boosting Fidelity and Text Consistency in Customizable Human Image Generation
par: Wang, Ye, et autres
Publié: (2025) -
A training-free framework for high-fidelity appearance transfer via diffusion transformers
par: Gu, Shengrong, et autres
Publié: (2026)