SimuScene: Training and Benchmarking Code Generation to Simulate Physical Scenarios
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Yanan, Wang, Renxi, Wang, Yongxin, Liang, Xuezhi, Koto, Fajri, Baldwin, Timothy, Liang, Xiaodan, Li, Haonan |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents
por: Wang, Renxi, et al.
Publicado: (2025)
por: Wang, Renxi, et al.
Publicado: (2025)
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
por: Yari, Amir Hossein, et al.
Publicado: (2026)
por: Yari, Amir Hossein, et al.
Publicado: (2026)
Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
por: Yang, Zhicheng, et al.
Publicado: (2025)
por: Yang, Zhicheng, et al.
Publicado: (2025)
Cracking the Code: Multi-domain LLM Evaluation on Real-World Professional Exams in Indonesia
por: Koto, Fajri
Publicado: (2024)
por: Koto, Fajri
Publicado: (2024)
IndoCulture: Exploring Geographically-Influenced Cultural Commonsense Reasoning Across Eleven Indonesian Provinces
por: Koto, Fajri, et al.
Publicado: (2024)
por: Koto, Fajri, et al.
Publicado: (2024)
SimuGen: Multi-modal Agentic Framework for Constructing Block Diagram-Based Simulation Models
por: Ren, Xinxing, et al.
Publicado: (2025)
por: Ren, Xinxing, et al.
Publicado: (2025)
JailNewsBench: Multi-Lingual and Regional Benchmark for Fake News Generation under Jailbreak Attacks
por: Kaneko, Masahiro, et al.
Publicado: (2026)
por: Kaneko, Masahiro, et al.
Publicado: (2026)
DeepMF: Deep Motion Factorization for Closed-Loop Safety-Critical Driving Scenario Simulation
por: Li, Yizhe, et al.
Publicado: (2024)
por: Li, Yizhe, et al.
Publicado: (2024)
OSS-Bench: Benchmark Generator for Coding LLMs
por: Jiang, Yuancheng, et al.
Publicado: (2025)
por: Jiang, Yuancheng, et al.
Publicado: (2025)
Accordion-Thinking: Self-Regulated Step Summaries for Efficient and Readable LLM Reasoning
por: Yang, Zhicheng, et al.
Publicado: (2026)
por: Yang, Zhicheng, et al.
Publicado: (2026)
Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning
por: Yang, Zhicheng, et al.
Publicado: (2026)
por: Yang, Zhicheng, et al.
Publicado: (2026)
ToolGen: Unified Tool Retrieval and Calling via Generation
por: Wang, Renxi, et al.
Publicado: (2024)
por: Wang, Renxi, et al.
Publicado: (2024)
Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration
por: Yang, Zhicheng, et al.
Publicado: (2025)
por: Yang, Zhicheng, et al.
Publicado: (2025)
Are Multilingual LLMs Culturally-Diverse Reasoners? An Investigation into Multicultural Proverbs and Sayings
por: Liu, Chen Cecilia, et al.
Publicado: (2023)
por: Liu, Chen Cecilia, et al.
Publicado: (2023)
LLM360 K2: Building a 65B 360-Open-Source Large Language Model from Scratch
por: Liu, Zhengzhong, et al.
Publicado: (2025)
por: Liu, Zhengzhong, et al.
Publicado: (2025)
CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X
por: Zheng, Qinkai, et al.
Publicado: (2023)
por: Zheng, Qinkai, et al.
Publicado: (2023)
CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning
por: Wang, Yongxin, et al.
Publicado: (2025)
por: Wang, Yongxin, et al.
Publicado: (2025)
Learning and Generating Diverse Residential Load Patterns Using GAN with Weakly-Supervised Training and Weight Selection
por: Liang, Xinyu, et al.
Publicado: (2025)
por: Liang, Xinyu, et al.
Publicado: (2025)
AuroRA: Breaking Low-Rank Bottleneck of LoRA with Nonlinear Mapping
por: Dong, Haonan, et al.
Publicado: (2025)
por: Dong, Haonan, et al.
Publicado: (2025)
Proximal Oracles for Optimization and Sampling
por: Liang, Jiaming, et al.
Publicado: (2024)
por: Liang, Jiaming, et al.
Publicado: (2024)
Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents
por: Wang, Renxi, et al.
Publicado: (2024)
por: Wang, Renxi, et al.
Publicado: (2024)
When Forgetting Builds Reliability: LLM Unlearning for Reliable Hardware Code Generation
por: Liang, Yiwen, et al.
Publicado: (2025)
por: Liang, Yiwen, et al.
Publicado: (2025)
EACO: Enhancing Alignment in Multimodal LLMs via Critical Observation
por: Wang, Yongxin, et al.
Publicado: (2024)
por: Wang, Yongxin, et al.
Publicado: (2024)
Zero-shot Sentiment Analysis in Low-Resource Languages Using a Multilingual Sentiment Lexicon
por: Koto, Fajri, et al.
Publicado: (2024)
por: Koto, Fajri, et al.
Publicado: (2024)
Simulating Training Data Leakage in Multiple-Choice Benchmarks for LLM Evaluation
por: Hidayat, Naila Shafirni, et al.
Publicado: (2025)
por: Hidayat, Naila Shafirni, et al.
Publicado: (2025)
Listen, Correct, and Feed Back: Spoken Pedagogical Feedback Generation
por: Liang, Junhong, et al.
Publicado: (2026)
por: Liang, Junhong, et al.
Publicado: (2026)
Training and Evaluating with Human Label Variation: An Empirical Study
por: Kurniawan, Kemal, et al.
Publicado: (2025)
por: Kurniawan, Kemal, et al.
Publicado: (2025)
Benchmarking Gender and Political Bias in Large Language Models
por: Yang, Jinrui, et al.
Publicado: (2025)
por: Yang, Jinrui, et al.
Publicado: (2025)
ChatScene: Knowledge-Enabled Safety-Critical Scenario Generation for Autonomous Vehicles
por: Zhang, Jiawei, et al.
Publicado: (2024)
por: Zhang, Jiawei, et al.
Publicado: (2024)
LMC: Fast Training of GNNs via Subgraph Sampling with Provable Convergence
por: Shi, Zhihao, et al.
Publicado: (2023)
por: Shi, Zhihao, et al.
Publicado: (2023)
FedCCRL: Federated Domain Generalization with Cross-Client Representation Learning
por: Wang, Xinpeng, et al.
Publicado: (2024)
por: Wang, Xinpeng, et al.
Publicado: (2024)
Reinforcing General Reasoning without Verifiers
por: Zhou, Xiangxin, et al.
Publicado: (2025)
por: Zhou, Xiangxin, et al.
Publicado: (2025)
SimuDICE: Offline Policy Optimization Through World Model Updates and DICE Estimation
por: Brita, Catalin E., et al.
Publicado: (2024)
por: Brita, Catalin E., et al.
Publicado: (2024)
Provably Convergent Decentralized Optimization over Directed Graphs under Generalized Smoothness
por: Bo, Yanan, et al.
Publicado: (2026)
por: Bo, Yanan, et al.
Publicado: (2026)
ADAPTive Input Training for Many-to-One Pre-Training on Time-Series Classification
por: Quinlan, Paul, et al.
Publicado: (2026)
por: Quinlan, Paul, et al.
Publicado: (2026)
GraphSL: An Open-Source Library for Graph Source Localization Approaches and Benchmark Datasets
por: Wang, Junxiang, et al.
Publicado: (2024)
por: Wang, Junxiang, et al.
Publicado: (2024)
Take the Bull by the Horns: Hard Sample-Reweighted Continual Training Improves LLM Generalization
por: Chen, Xuxi, et al.
Publicado: (2024)
por: Chen, Xuxi, et al.
Publicado: (2024)
CMMLU: Measuring massive multitask language understanding in Chinese
por: Li, Haonan, et al.
Publicado: (2023)
por: Li, Haonan, et al.
Publicado: (2023)
Generating Compositional Scenes via Text-to-image RGBA Instance Generation
por: Fontanella, Alessandro, et al.
Publicado: (2024)
por: Fontanella, Alessandro, et al.
Publicado: (2024)
AlignedCoT: Prompting Large Language Models via Native-Speaking Demonstrations
por: Yang, Zhicheng, et al.
Publicado: (2023)
por: Yang, Zhicheng, et al.
Publicado: (2023)
Ejemplares similares
-
AgentFly: Extensible and Scalable Reinforcement Learning for LM Agents
por: Wang, Renxi, et al.
Publicado: (2025) -
AMIR-GRPO: Inducing Implicit Preference Signals into GRPO
por: Yari, Amir Hossein, et al.
Publicado: (2026) -
Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers
por: Yang, Zhicheng, et al.
Publicado: (2025) -
Cracking the Code: Multi-domain LLM Evaluation on Real-World Professional Exams in Indonesia
por: Koto, Fajri
Publicado: (2024) -
IndoCulture: Exploring Geographically-Influenced Cultural Commonsense Reasoning Across Eleven Indonesian Provinces
por: Koto, Fajri, et al.
Publicado: (2024)