RealVLG-R1: A Large-Scale Real-World Visual-Language Grounding Benchmark for Robotic Perception and Manipulation
Fuente:
arXiv
Salvato in:
| Autori principali: | Li, Linfei, Zhang, Lin, Shen, Ying |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
di: He, Jiawei, et al.
Pubblicazione: (2025)
di: He, Jiawei, et al.
Pubblicazione: (2025)
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
di: Wang, Tianyu, et al.
Pubblicazione: (2024)
di: Wang, Tianyu, et al.
Pubblicazione: (2024)
RGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World Scenarios
di: Zhao, Tianyi, et al.
Pubblicazione: (2025)
di: Zhao, Tianyi, et al.
Pubblicazione: (2025)
AV-Deepfake1M++: A Large-Scale Audio-Visual Deepfake Benchmark with Real-World Perturbations
di: Cai, Zhixi, et al.
Pubblicazione: (2025)
di: Cai, Zhixi, et al.
Pubblicazione: (2025)
SynPlay: Large-Scale Synthetic Human Data with Real-World Diversity for Aerial-View Perception
di: Yim, Jinsub, et al.
Pubblicazione: (2024)
di: Yim, Jinsub, et al.
Pubblicazione: (2024)
GS3LAM: Gaussian Semantic Splatting SLAM
di: Li, Linfei, et al.
Pubblicazione: (2026)
di: Li, Linfei, et al.
Pubblicazione: (2026)
PhyEdit: Towards Real-World Object Manipulation via Physically-Grounded Image Editing
di: Xu, Ruihang, et al.
Pubblicazione: (2026)
di: Xu, Ruihang, et al.
Pubblicazione: (2026)
INR-Bench: A Unified Benchmark for Implicit Neural Representations in Multi-Domain Regression and Reconstruction
di: Li, Linfei, et al.
Pubblicazione: (2025)
di: Li, Linfei, et al.
Pubblicazione: (2025)
Real-Time Privacy Preservation for Robot Visual Perception
di: Choi, Minkyu, et al.
Pubblicazione: (2025)
di: Choi, Minkyu, et al.
Pubblicazione: (2025)
SCENEREPLICA: Benchmarking Real-World Robot Manipulation by Creating Replicable Scenes
di: Khargonkar, Ninad, et al.
Pubblicazione: (2023)
di: Khargonkar, Ninad, et al.
Pubblicazione: (2023)
Manipulate-Anything: Automating Real-World Robots using Vision-Language Models
di: Duan, Jiafei, et al.
Pubblicazione: (2024)
di: Duan, Jiafei, et al.
Pubblicazione: (2024)
MathScape: Benchmarking Multimodal Large Language Models in Real-World Mathematical Contexts
di: Liang, Hao, et al.
Pubblicazione: (2024)
di: Liang, Hao, et al.
Pubblicazione: (2024)
SmartSplat: Feature-Smart Gaussians for Scalable Compression of Ultra-High-Resolution Images
di: Li, Linfei, et al.
Pubblicazione: (2025)
di: Li, Linfei, et al.
Pubblicazione: (2025)
AGC-Drive: A Large-Scale Dataset for Real-World Aerial-Ground Collaboration in Driving Scenarios
di: Hou, Yunhao, et al.
Pubblicazione: (2025)
di: Hou, Yunhao, et al.
Pubblicazione: (2025)
Towards Real-World HDR Video Reconstruction: A Large-Scale Benchmark Dataset and A Two-Stage Alignment Network
di: Shu, Yong, et al.
Pubblicazione: (2024)
di: Shu, Yong, et al.
Pubblicazione: (2024)
DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World
di: Li, Xiangtai, et al.
Pubblicazione: (2025)
di: Li, Xiangtai, et al.
Pubblicazione: (2025)
RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought
di: Qiao, Junbo, et al.
Pubblicazione: (2025)
di: Qiao, Junbo, et al.
Pubblicazione: (2025)
VisualTrans: A Benchmark for Real-World Visual Transformation Reasoning
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
di: Ji, Yuheng, et al.
Pubblicazione: (2025)
MTMMC: A Large-Scale Real-World Multi-Modal Camera Tracking Benchmark
di: Woo, Sanghyun, et al.
Pubblicazione: (2024)
di: Woo, Sanghyun, et al.
Pubblicazione: (2024)
Evaluating Real-World Robot Manipulation Policies in Simulation
di: Li, Xuanlin, et al.
Pubblicazione: (2024)
di: Li, Xuanlin, et al.
Pubblicazione: (2024)
TartanGround: A Large-Scale Dataset for Ground Robot Perception and Navigation
di: Patel, Manthan, et al.
Pubblicazione: (2025)
di: Patel, Manthan, et al.
Pubblicazione: (2025)
PolyReal: A Benchmark for Real-World Polymer Science Workflows
di: Liu, Wanhao, et al.
Pubblicazione: (2026)
di: Liu, Wanhao, et al.
Pubblicazione: (2026)
RealD$^2$iff: Bridging Real-World Gap in Robot Manipulation via Depth Diffusion
di: Liang, Xiujian, et al.
Pubblicazione: (2025)
di: Liang, Xiujian, et al.
Pubblicazione: (2025)
HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction
di: Shi, Zhonghao, et al.
Pubblicazione: (2025)
di: Shi, Zhonghao, et al.
Pubblicazione: (2025)
Real3D: Scaling Up Large Reconstruction Models with Real-World Images
di: Jiang, Hanwen, et al.
Pubblicazione: (2024)
di: Jiang, Hanwen, et al.
Pubblicazione: (2024)
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
di: Gao, Hong, et al.
Pubblicazione: (2025)
di: Gao, Hong, et al.
Pubblicazione: (2025)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
di: Shan, Haozhe, et al.
Pubblicazione: (2026)
RTV-Bench: Benchmarking MLLM Continuous Perception, Understanding and Reasoning through Real-Time Video
di: Xun, Shuhang, et al.
Pubblicazione: (2025)
di: Xun, Shuhang, et al.
Pubblicazione: (2025)
Advancing Real-World Parking Slot Detection with Large-Scale Dataset and Semi-Supervised Baseline
di: Zhang, Zhihao, et al.
Pubblicazione: (2025)
di: Zhang, Zhihao, et al.
Pubblicazione: (2025)
MathReal: We Keep It Real! A Real Scene Benchmark for Evaluating Math Reasoning in Multimodal Large Language Models
di: Feng, Jun, et al.
Pubblicazione: (2025)
di: Feng, Jun, et al.
Pubblicazione: (2025)
How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark
di: Liu, Yuanye, et al.
Pubblicazione: (2026)
di: Liu, Yuanye, et al.
Pubblicazione: (2026)
CBVS: A Large-Scale Chinese Image-Text Benchmark for Real-World Short Video Search Scenarios
di: Qiao, Xiangshuo, et al.
Pubblicazione: (2024)
di: Qiao, Xiangshuo, et al.
Pubblicazione: (2024)
One-Step Diffusion-based Real-World Image Super-Resolution with Visual Perception Distillation
di: Wu, Xue, et al.
Pubblicazione: (2025)
di: Wu, Xue, et al.
Pubblicazione: (2025)
Grounding World Simulation Models in a Real-World Metropolis
di: Seo, Junyoung, et al.
Pubblicazione: (2026)
di: Seo, Junyoung, et al.
Pubblicazione: (2026)
RoboGround: Robotic Manipulation with Grounded Vision-Language Priors
di: Huang, Haifeng, et al.
Pubblicazione: (2025)
di: Huang, Haifeng, et al.
Pubblicazione: (2025)
Flow-Anything: Learning Real-World Optical Flow Estimation from Large-Scale Single-view Images
di: Liang, Yingping, et al.
Pubblicazione: (2025)
di: Liang, Yingping, et al.
Pubblicazione: (2025)
TwinAligner: Visual-Dynamic Alignment Empowers Physics-aware Real2Sim2Real for Robotic Manipulation
di: Fan, Hongwei, et al.
Pubblicazione: (2025)
di: Fan, Hongwei, et al.
Pubblicazione: (2025)
Simultaneous Tactile-Visual Perception for Learning Multimodal Robot Manipulation
di: Li, Yuyang, et al.
Pubblicazione: (2025)
di: Li, Yuyang, et al.
Pubblicazione: (2025)
POINav: Benchmarking and Enhancing Final-Meters Arrival in Real-World Vision-Language Navigation
di: Gong, Ruiyan, et al.
Pubblicazione: (2026)
di: Gong, Ruiyan, et al.
Pubblicazione: (2026)
VEBench:Benchmarking Large Multimodal Models for Real-World Video Editing
di: Deng, Andong, et al.
Pubblicazione: (2026)
di: Deng, Andong, et al.
Pubblicazione: (2026)
Documenti analoghi
-
DexVLG: Dexterous Vision-Language-Grasp Model at Scale
di: He, Jiawei, et al.
Pubblicazione: (2025) -
Polaris: Open-ended Interactive Robotic Manipulation via Syn2Real Visual Grounding and Large Language Models
di: Wang, Tianyu, et al.
Pubblicazione: (2024) -
RGBT-Ground Benchmark: Visual Grounding Beyond RGB in Complex Real-World Scenarios
di: Zhao, Tianyi, et al.
Pubblicazione: (2025) -
AV-Deepfake1M++: A Large-Scale Audio-Visual Deepfake Benchmark with Real-World Perturbations
di: Cai, Zhixi, et al.
Pubblicazione: (2025) -
SynPlay: Large-Scale Synthetic Human Data with Real-World Diversity for Aerial-View Perception
di: Yim, Jinsub, et al.
Pubblicazione: (2024)