Salvato in:
| Autori principali: | Lu, Shuo, Xu, Yinuo, Yu, Kecheng, Jiang, Siru, Yu, Yongcan, Wang, Yubin, Yang, Haitao, Zhang, Yuxiang, Wang, Bin, He, Ran, Liang, Jian |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2606.01869 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
WorldCoder, a Model-Based LLM Agent: Building World Models by Writing Code and Interacting with the Environment
di: Tang, Hao, et al.
Pubblicazione: (2024)
di: Tang, Hao, et al.
Pubblicazione: (2024)
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
di: Wang, Yanbo, et al.
Pubblicazione: (2025)
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
di: Wang, Yanbo, et al.
Pubblicazione: (2026)
STAMP: Outlier-Aware Test-Time Adaptation with Stable Memory Replay
di: Yu, Yongcan, et al.
Pubblicazione: (2024)
di: Yu, Yongcan, et al.
Pubblicazione: (2024)
Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation
di: Lu, Shuo, et al.
Pubblicazione: (2026)
di: Lu, Shuo, et al.
Pubblicazione: (2026)
Cooperative Pseudo Labeling for Unsupervised Federated Classification
di: Guo, Kuangpu, et al.
Pubblicazione: (2025)
di: Guo, Kuangpu, et al.
Pubblicazione: (2025)
ShoppingBench: A Real-World Intent-Grounded Shopping Benchmark for LLM-based Agents
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
di: Wang, Jiangyuan, et al.
Pubblicazione: (2025)
World2Mind: Cognition Toolkit for Allocentric Spatial Reasoning in Foundation Models
di: Ruan, Shouwei, et al.
Pubblicazione: (2026)
di: Ruan, Shouwei, et al.
Pubblicazione: (2026)
Understanding and Mitigating Spurious Signal Amplification in Test-Time Reinforcement Learning for Math Reasoning
di: Yu, Yongcan, et al.
Pubblicazione: (2026)
di: Yu, Yongcan, et al.
Pubblicazione: (2026)
T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
di: Chen, Yubin, et al.
Pubblicazione: (2025)
di: Chen, Yubin, et al.
Pubblicazione: (2025)
Reassessing the Role of Supervised Fine-Tuning: An Empirical Study in VLM Reasoning
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
di: Yu, Yongcan, et al.
Pubblicazione: (2025)
How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1
di: Xu, Yinuo, et al.
Pubblicazione: (2026)
di: Xu, Yinuo, et al.
Pubblicazione: (2026)
PhyGround: Benchmarking Physical Reasoning in Generative World Models
di: Lin, Juyi, et al.
Pubblicazione: (2026)
di: Lin, Juyi, et al.
Pubblicazione: (2026)
WorldGenBench: A World-Knowledge-Integrated Benchmark for Reasoning-Driven Text-to-Image Generation
di: Zhang, Daoan, et al.
Pubblicazione: (2025)
di: Zhang, Daoan, et al.
Pubblicazione: (2025)
DeepResearch-Slice: Bridging the Retrieval-Utilization Gap via Explicit Text Slicing
di: Lu, Shuo, et al.
Pubblicazione: (2025)
di: Lu, Shuo, et al.
Pubblicazione: (2025)
MolRecBench-Wild: A Real-World Benchmark for Optical Chemical Structure Recognition
di: Yang, Haote, et al.
Pubblicazione: (2026)
di: Yang, Haote, et al.
Pubblicazione: (2026)
QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models
di: Wu, Yao, et al.
Pubblicazione: (2026)
di: Wu, Yao, et al.
Pubblicazione: (2026)
GitTaskBench: A Benchmark for Code Agents Solving Real-World Tasks Through Code Repository Leveraging
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
di: Ni, Ziyi, et al.
Pubblicazione: (2025)
ABC-Bench: Benchmarking Agentic Backend Coding in Real-World Development
di: Yang, Jie, et al.
Pubblicazione: (2026)
di: Yang, Jie, et al.
Pubblicazione: (2026)
RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation
di: Jiang, Feng, et al.
Pubblicazione: (2026)
di: Jiang, Feng, et al.
Pubblicazione: (2026)
RoboTrustBench: Benchmarking the Trustworthiness of Video World Models for Robotic Manipulation
di: Li, Huiqiong, et al.
Pubblicazione: (2026)
di: Li, Huiqiong, et al.
Pubblicazione: (2026)
CoderEval: A Benchmark of Pragmatic Code Generation with Generative Pre-trained Models
di: Yu, Hao, et al.
Pubblicazione: (2023)
di: Yu, Hao, et al.
Pubblicazione: (2023)
WorldModelBench: Judging Video Generation Models As World Models
di: Li, Dacheng, et al.
Pubblicazione: (2025)
di: Li, Dacheng, et al.
Pubblicazione: (2025)
T$^3$Bench: Benchmarking Current Progress in Text-to-3D Generation
di: He, Yuze, et al.
Pubblicazione: (2023)
di: He, Yuze, et al.
Pubblicazione: (2023)
PhysBench: Benchmarking and Enhancing Vision-Language Models for Physical World Understanding
di: Chow, Wei, et al.
Pubblicazione: (2025)
di: Chow, Wei, et al.
Pubblicazione: (2025)
Frustratingly Easy Feature Reconstruction for Out-of-Distribution Detection
di: Wang, Yingsheng, et al.
Pubblicazione: (2025)
di: Wang, Yingsheng, et al.
Pubblicazione: (2025)
WorldSimBench: Towards Video Generation Models as World Simulators
di: Qin, Yiran, et al.
Pubblicazione: (2024)
di: Qin, Yiran, et al.
Pubblicazione: (2024)
NV-Bench: Benchmark of Nonverbal Vocalization Synthesis for Expressive Text-to-Speech Generation
di: Ni, Qinke, et al.
Pubblicazione: (2026)
di: Ni, Qinke, et al.
Pubblicazione: (2026)
RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios
di: Zhang, Yibo, et al.
Pubblicazione: (2026)
di: Zhang, Yibo, et al.
Pubblicazione: (2026)
RealFactBench: A Benchmark for Evaluating Large Language Models in Real-World Fact-Checking
di: Yang, Shuo, et al.
Pubblicazione: (2025)
di: Yang, Shuo, et al.
Pubblicazione: (2025)
OptiWorld: Optimal Control for Video World Generation under Physical Constraints
di: Yuan, Yu, et al.
Pubblicazione: (2026)
di: Yuan, Yu, et al.
Pubblicazione: (2026)
InCoder-32B-Thinking: Industrial Code World Model for Thinking
di: Yang, Jian, et al.
Pubblicazione: (2026)
di: Yang, Jian, et al.
Pubblicazione: (2026)
WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors
di: Wu, Keming, et al.
Pubblicazione: (2026)
di: Wu, Keming, et al.
Pubblicazione: (2026)
WAInjectBench: Benchmarking Prompt Injection Detections for Web Agents
di: Liu, Yinuo, et al.
Pubblicazione: (2025)
di: Liu, Yinuo, et al.
Pubblicazione: (2025)
MEGA-Bench: Scaling Multimodal Evaluation to over 500 Real-World Tasks
di: Chen, Jiacheng, et al.
Pubblicazione: (2024)
di: Chen, Jiacheng, et al.
Pubblicazione: (2024)
AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents
di: Hu, Lingxiang, et al.
Pubblicazione: (2026)
di: Hu, Lingxiang, et al.
Pubblicazione: (2026)
MobiFlow: Real-World Mobile Agent Benchmarking through Trajectory Fusion
di: Feng, Yunfei, et al.
Pubblicazione: (2026)
di: Feng, Yunfei, et al.
Pubblicazione: (2026)
Unify-Agent: A Unified Multimodal Agent for World-Grounded Image Synthesis
di: Chen, Shuang, et al.
Pubblicazione: (2026)
di: Chen, Shuang, et al.
Pubblicazione: (2026)
DecompileBench: A Comprehensive Benchmark for Evaluating Decompilers in Real-World Scenarios
di: Gao, Zeyu, et al.
Pubblicazione: (2025)
di: Gao, Zeyu, et al.
Pubblicazione: (2025)
Documenti analoghi
-
WorldCoder, a Model-Based LLM Agent: Building World Models by Writing Code and Interacting with the Environment
di: Tang, Hao, et al.
Pubblicazione: (2024) -
Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models
di: Yu, Yongcan, et al.
Pubblicazione: (2025) -
A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models
di: Wang, Yanbo, et al.
Pubblicazione: (2025) -
Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning
di: Wang, Yanbo, et al.
Pubblicazione: (2026) -
STAMP: Outlier-Aware Test-Time Adaptation with Stable Memory Replay
di: Yu, Yongcan, et al.
Pubblicazione: (2024)