WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Ding, Shuangrui, Dai, Xuanlang, Xing, Long, Ding, Shengyuan, Liu, Ziyu, JingYi, Yang, Yang, Penghui, Zhang, Zhixiong, Wei, Xilin, Fang, Xinyu, Ma, Yubo, Duan, Haodong, Shao, Jing, Wang, Jiaqi, Lin, Dahua, Chen, Kai, Zang, Yuhang |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Visual-ERM: Reward Modeling for Visual Equivalence
par: Liu, Ziyu, et autres
Publié: (2026)
par: Liu, Ziyu, et autres
Publié: (2026)
SPARK: Synergistic Policy And Reward Co-Evolving Framework
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
par: Zhang, Zhixiong, et autres
Publié: (2025)
par: Zhang, Zhixiong, et autres
Publié: (2025)
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
par: Zhang, Zhixiong, et autres
Publié: (2026)
par: Zhang, Zhixiong, et autres
Publié: (2026)
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
par: Liu, Zihan, et autres
Publié: (2025)
par: Liu, Zihan, et autres
Publié: (2025)
InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model
par: Zang, Yuhang, et autres
Publié: (2025)
par: Zang, Yuhang, et autres
Publié: (2025)
Advancing Complex Video Object Segmentation via Progressive Concept Construction
par: Zhang, Zhixiong, et autres
Publié: (2025)
par: Zhang, Zhixiong, et autres
Publié: (2025)
Streaming Long Video Understanding with Large Language Models
par: Qian, Rui, et autres
Publié: (2024)
par: Qian, Rui, et autres
Publié: (2024)
ARM-Thinker: Reinforcing Multimodal Generative Reward Models with Agentic Tool Use and Visual Reasoning
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
Dispider: Enabling Video LLMs with Active Real-Time Interaction via Disentangled Perception, Decision, and Reaction
par: Qian, Rui, et autres
Publié: (2025)
par: Qian, Rui, et autres
Publié: (2025)
MM-IFEngine: Towards Multimodal Instruction Following
par: Ding, Shengyuan, et autres
Publié: (2025)
par: Ding, Shengyuan, et autres
Publié: (2025)
Visual-RFT: Visual Reinforcement Fine-Tuning
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
Rethinking Image-to-Video Adaptation: An Object-centric Perspective
par: Qian, Rui, et autres
Publié: (2024)
par: Qian, Rui, et autres
Publié: (2024)
SAM2Long: Enhancing SAM 2 for Long Video Segmentation with a Training-Free Memory Tree
par: Ding, Shuangrui, et autres
Publié: (2024)
par: Ding, Shuangrui, et autres
Publié: (2024)
HyperEvent: A Strong Baseline for Dynamic Link Prediction via Relative Structural Encoding
par: Gao, Jian, et autres
Publié: (2025)
par: Gao, Jian, et autres
Publié: (2025)
Visual Agentic Reinforcement Fine-Tuning
par: Liu, Ziyu, et autres
Publié: (2025)
par: Liu, Ziyu, et autres
Publié: (2025)
Think Visually, Reason Textually: Vision-Language Synergy in ARC
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?
par: Li, Yifei, et autres
Publié: (2025)
par: Li, Yifei, et autres
Publié: (2025)
MIA-DPO: Multi-Image Augmented Direct Preference Optimization For Large Vision-Language Models
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Semantics Meets Temporal Correspondence: Self-supervised Object-centric Learning in Videos
par: Qian, Rui, et autres
Publié: (2023)
par: Qian, Rui, et autres
Publié: (2023)
VideoRoPE: What Makes for Good Video Rotary Position Embedding?
par: Wei, Xilin, et autres
Publié: (2025)
par: Wei, Xilin, et autres
Publié: (2025)
Spatial-SSRL: Enhancing Spatial Understanding via Self-Supervised Reinforcement Learning
par: Liu, Yuhong, et autres
Publié: (2025)
par: Liu, Yuhong, et autres
Publié: (2025)
BoostStep: Boosting mathematical capability of Large Language Models via improved single-step reasoning
par: Zhang, Beichen, et autres
Publié: (2025)
par: Zhang, Beichen, et autres
Publié: (2025)
SIM-CoT: Supervised Implicit Chain-of-Thought
par: Wei, Xilin, et autres
Publié: (2025)
par: Wei, Xilin, et autres
Publié: (2025)
Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition
par: Dong, Yuhao, et autres
Publié: (2026)
par: Dong, Yuhao, et autres
Publié: (2026)
Betrayed by Attention: A Simple yet Effective Approach for Self-supervised Video Object Segmentation
par: Ding, Shuangrui, et autres
Publié: (2023)
par: Ding, Shuangrui, et autres
Publié: (2023)
CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning
par: Sun, Zeyi, et autres
Publié: (2025)
par: Sun, Zeyi, et autres
Publié: (2025)
ScaleCap: Inference-Time Scalable Image Captioning via Dual-Modality Debiasing
par: Xing, Long, et autres
Publié: (2025)
par: Xing, Long, et autres
Publié: (2025)
EndoCoT: Scaling Endogenous Chain-of-Thought Reasoning in Diffusion Models
par: Dai, Xuanlang, et autres
Publié: (2026)
par: Dai, Xuanlang, et autres
Publié: (2026)
MetaClaw: Just Talk -- An Agent That Meta-Learns and Evolves in the Wild
par: Xia, Peng, et autres
Publié: (2026)
par: Xia, Peng, et autres
Publié: (2026)
SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience
par: Sun, Zeyi, et autres
Publié: (2025)
par: Sun, Zeyi, et autres
Publié: (2025)
Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs
par: Li, Xiaozhe, et autres
Publié: (2026)
par: Li, Xiaozhe, et autres
Publié: (2026)
OPT-BENCH: Evaluating LLM Agent on Large-Scale Search Spaces Optimization Problems
par: Li, Xiaozhe, et autres
Publié: (2025)
par: Li, Xiaozhe, et autres
Publié: (2025)
NP-Engine: Empowering Optimization Reasoning in Large Language Models with Verifiable Synthetic NP Problems
par: Li, Xiaozhe, et autres
Publié: (2025)
par: Li, Xiaozhe, et autres
Publié: (2025)
OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces
par: Li, Xiaozhe, et autres
Publié: (2026)
par: Li, Xiaozhe, et autres
Publié: (2026)
Visual Self-Refine: A Pixel-Guided Paradigm for Accurate Chart Parsing
par: Li, Jinsong, et autres
Publié: (2026)
par: Li, Jinsong, et autres
Publié: (2026)
Beyond Fixed: Training-Free Variable-Length Denoising for Diffusion Large Language Models
par: Li, Jinsong, et autres
Publié: (2025)
par: Li, Jinsong, et autres
Publié: (2025)
MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
ClawBench: Can AI Agents Complete Everyday Online Tasks?
par: Zhang, Yuxuan, et autres
Publié: (2026)
par: Zhang, Yuxuan, et autres
Publié: (2026)
Towards Storage-Efficient Visual Document Retrieval: An Empirical Study on Reducing Patch-Level Embeddings
par: Ma, Yubo, et autres
Publié: (2025)
par: Ma, Yubo, et autres
Publié: (2025)
Documents similaires
-
Visual-ERM: Reward Modeling for Visual Equivalence
par: Liu, Ziyu, et autres
Publié: (2026) -
SPARK: Synergistic Policy And Reward Co-Evolving Framework
par: Liu, Ziyu, et autres
Publié: (2025) -
2nd Place Report of MOSEv2 Challenge 2025: Concept Guided Video Object Segmentation via SeC
par: Zhang, Zhixiong, et autres
Publié: (2025) -
SetCon: Towards Open-Ended Referring Segmentation via Set-Level Concept Prediction
par: Zhang, Zhixiong, et autres
Publié: (2026) -
SongGen: A Single Stage Auto-regressive Transformer for Text-to-Song Generation
par: Liu, Zihan, et autres
Publié: (2025)