Beyond State Consistency: Behavior Consistency in Text-Based World Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Huang, Youling, Chen, Guanqiao, Yao, Junchi, Wang, Lu, Yang, Fangkai, Du, Chao, Zhao, ChenZhuo, Zhao, Pu, Lin, Qingwei, Rajmohan, Saravan, Zhang, Dongmei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
por: Huang, Chenghua, et al.
Publicado: (2025)
por: Huang, Chenghua, et al.
Publicado: (2025)
Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
por: Wang, Qibin, et al.
Publicado: (2025)
por: Wang, Qibin, et al.
Publicado: (2025)
ExeCoder: Empowering Large Language Models with Executability Representation for Code Translation
por: He, Minghua, et al.
Publicado: (2025)
por: He, Minghua, et al.
Publicado: (2025)
Self-Evolved Reward Learning for LLMs
por: Huang, Chenghua, et al.
Publicado: (2024)
por: Huang, Chenghua, et al.
Publicado: (2024)
RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository
por: Peng, Zhiyuan, et al.
Publicado: (2026)
por: Peng, Zhiyuan, et al.
Publicado: (2026)
From Reasoning to Answer: Empirical, Attention-Based and Mechanistic Insights into Distilled DeepSeek R1 Models
por: Zhang, Jue, et al.
Publicado: (2025)
por: Zhang, Jue, et al.
Publicado: (2025)
DoVer: Intervention-Driven Auto Debugging for LLM Multi-Agent Systems
por: Ma, Ming, et al.
Publicado: (2025)
por: Ma, Ming, et al.
Publicado: (2025)
AXIS: Efficient Human-Agent-Computer Interaction with API-First LLM-Based Agents
por: Lu, Junting, et al.
Publicado: (2024)
por: Lu, Junting, et al.
Publicado: (2024)
AI Delegates with a Dual Focus: Ensuring Privacy and Strategic Self-Disclosure
por: Zhang, Zhiyang, et al.
Publicado: (2024)
por: Zhang, Zhiyang, et al.
Publicado: (2024)
AdaptFlow: Adaptive Workflow Optimization via Meta-Learning
por: Zhu, Runchuan, et al.
Publicado: (2025)
por: Zhu, Runchuan, et al.
Publicado: (2025)
WarriorCoder: Learning from Expert Battles to Augment Code Large Language Models
por: Feng, Huawen, et al.
Publicado: (2024)
por: Feng, Huawen, et al.
Publicado: (2024)
WarriorMath: Enhancing the Mathematical Ability of Large Language Models with a Defect-aware Framework
por: Chen, Yue, et al.
Publicado: (2025)
por: Chen, Yue, et al.
Publicado: (2025)
AutoRAG-HP: Automatic Online Hyper-Parameter Tuning for Retrieval-Augmented Generation
por: Fu, Jia, et al.
Publicado: (2024)
por: Fu, Jia, et al.
Publicado: (2024)
Thread: A Logic-Based Data Organization Paradigm for How-To Question Answering with Retrieval Augmented Generation
por: An, Kaikai, et al.
Publicado: (2024)
por: An, Kaikai, et al.
Publicado: (2024)
Text2Grad: Reinforcement Learning from Natural Language Feedback
por: Wang, Hanyang, et al.
Publicado: (2025)
por: Wang, Hanyang, et al.
Publicado: (2025)
The Vision of Autonomic Computing: Can LLMs Make It a Reality?
por: Zhang, Zhiyang, et al.
Publicado: (2024)
por: Zhang, Zhiyang, et al.
Publicado: (2024)
Contrastive Learning with Negative Sampling Correction
por: Wang, Lu, et al.
Publicado: (2024)
por: Wang, Lu, et al.
Publicado: (2024)
Nissist: An Incident Mitigation Copilot based on Troubleshooting Guides
por: An, Kaikai, et al.
Publicado: (2024)
por: An, Kaikai, et al.
Publicado: (2024)
A Tale of Two Graphs: Separating Knowledge Exploration from Outline Structure for Open-Ended Deep Research
por: Shi, Zhuofan, et al.
Publicado: (2026)
por: Shi, Zhuofan, et al.
Publicado: (2026)
VEM: Environment-Free Exploration for Training GUI Agent with Value Environment Model
por: Zheng, Jiani, et al.
Publicado: (2025)
por: Zheng, Jiani, et al.
Publicado: (2025)
EfficientRAG: Efficient Retriever for Multi-Hop Question Answering
por: Zhuang, Ziyuan, et al.
Publicado: (2024)
por: Zhuang, Ziyuan, et al.
Publicado: (2024)
LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals
por: Sun, Lihao, et al.
Publicado: (2026)
por: Sun, Lihao, et al.
Publicado: (2026)
Contrastive Attribution in the Wild: An Interpretability Analysis of LLM Failures on Realistic Benchmarks
por: Tan, Rongyuan, et al.
Publicado: (2026)
por: Tan, Rongyuan, et al.
Publicado: (2026)
COIN: Chance-Constrained Imitation Learning for Uncertainty-aware Adaptive Resource Oversubscription Policy
por: Wang, Lu, et al.
Publicado: (2024)
por: Wang, Lu, et al.
Publicado: (2024)
Computer-Using World Model
por: Guan, Yiming, et al.
Publicado: (2026)
por: Guan, Yiming, et al.
Publicado: (2026)
Skeleton-Guided-Translation: A Benchmarking Framework for Code Repository Translation with Fine-Grained Quality Evaluation
por: Zhang, Xing, et al.
Publicado: (2025)
por: Zhang, Xing, et al.
Publicado: (2025)
Call Me When Necessary: LLMs can Efficiently and Faithfully Reason over Structured Environments
por: Cheng, Sitao, et al.
Publicado: (2024)
por: Cheng, Sitao, et al.
Publicado: (2024)
Enabling Autonomic Microservice Management through Self-Learning Agents
por: Yu, Fenglin, et al.
Publicado: (2025)
por: Yu, Fenglin, et al.
Publicado: (2025)
AgentGen: Enhancing Planning Abilities for Large Language Model based Agent via Environment and Task Generation
por: Hu, Mengkang, et al.
Publicado: (2024)
por: Hu, Mengkang, et al.
Publicado: (2024)
Can Language Models Go Beyond Coding? Assessing the Capability of Language Models to Build Real-World Systems
por: Zhao, Chenyu, et al.
Publicado: (2025)
por: Zhao, Chenyu, et al.
Publicado: (2025)
Token-level Proximal Policy Optimization for Query Generation
por: Ouyang, Yichen, et al.
Publicado: (2024)
por: Ouyang, Yichen, et al.
Publicado: (2024)
An Advanced Reinforcement Learning Framework for Online Scheduling of Deferrable Workloads in Cloud Computing
por: Dong, Hang, et al.
Publicado: (2024)
por: Dong, Hang, et al.
Publicado: (2024)
Why does Prediction Accuracy Decrease over Time? Uncertain Positive Learning for Cloud Failure Prediction
por: Li, Haozhe, et al.
Publicado: (2024)
por: Li, Haozhe, et al.
Publicado: (2024)
Privacy in Action: Towards Realistic Privacy Mitigation and Evaluation for LLM-Powered Agents
por: Wang, Shouju, et al.
Publicado: (2025)
por: Wang, Shouju, et al.
Publicado: (2025)
CI-Work: Benchmarking Contextual Integrity in Enterprise LLM Agents
por: Fu, Wenjie, et al.
Publicado: (2026)
por: Fu, Wenjie, et al.
Publicado: (2026)
API Agents vs. GUI Agents: Divergence and Convergence
por: Zhang, Chaoyun, et al.
Publicado: (2025)
por: Zhang, Chaoyun, et al.
Publicado: (2025)
MEETING DELEGATE: Benchmarking LLMs on Attending Meetings on Our Behalf
por: Hu, Lingxiang, et al.
Publicado: (2025)
por: Hu, Lingxiang, et al.
Publicado: (2025)
Zipage: Maintain High Request Concurrency for LLM Reasoning through Compressed PagedAttention
por: Liao, Mengqi, et al.
Publicado: (2026)
por: Liao, Mengqi, et al.
Publicado: (2026)
Sharingan: Extract User Action Sequence from Desktop Recordings
por: Chen, Yanting, et al.
Publicado: (2024)
por: Chen, Yanting, et al.
Publicado: (2024)
Distill Not Only Data but Also Rewards: Can Smaller Language Models Surpass Larger Ones?
por: Zhang, Yudi, et al.
Publicado: (2025)
por: Zhang, Yudi, et al.
Publicado: (2025)
Ejemplares similares
-
Pretrain Value, Not Reward: Decoupled Value Policy Optimization
por: Huang, Chenghua, et al.
Publicado: (2025) -
Learning to Refine: Self-Refinement of Parallel Reasoning in LLMs
por: Wang, Qibin, et al.
Publicado: (2025) -
ExeCoder: Empowering Large Language Models with Executability Representation for Code Translation
por: He, Minghua, et al.
Publicado: (2025) -
Self-Evolved Reward Learning for LLMs
por: Huang, Chenghua, et al.
Publicado: (2024) -
RepoGenesis: Benchmarking End-to-End Microservice Generation from Readme to Repository
por: Peng, Zhiyuan, et al.
Publicado: (2026)