V-IRL: Grounding Virtual Intelligence in Real Life
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Jihan, Ding, Runyu, Brown, Ellis, Qi, Xiaojuan, Xie, Saining |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding
por: Yang, Jihan, et al.
Publicado: (2023)
por: Yang, Jihan, et al.
Publicado: (2023)
Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
por: Brown, Ellis, et al.
Publicado: (2025)
por: Brown, Ellis, et al.
Publicado: (2025)
Traveling Across Languages: Benchmarking Cross-Lingual Consistency in Multimodal LLMs
por: Wang, Hao, et al.
Publicado: (2025)
por: Wang, Hao, et al.
Publicado: (2025)
UniTok: A Unified Tokenizer for Visual Generation and Understanding
por: Ma, Chuofan, et al.
Publicado: (2025)
por: Ma, Chuofan, et al.
Publicado: (2025)
Visual IRL for Human-Like Robotic Manipulation
por: Asali, Ehsan, et al.
Publicado: (2024)
por: Asali, Ehsan, et al.
Publicado: (2024)
Can 3D Vision-Language Models Truly Understand Natural Language?
por: Deng, Weipeng, et al.
Publicado: (2024)
por: Deng, Weipeng, et al.
Publicado: (2024)
SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training
por: Chu, Tianzhe, et al.
Publicado: (2025)
por: Chu, Tianzhe, et al.
Publicado: (2025)
IRL-VLA: Training an Vision-Language-Action Policy via Reward World Model
por: Jiang, Anqing, et al.
Publicado: (2025)
por: Jiang, Anqing, et al.
Publicado: (2025)
Cambrian-P: Pose-Grounded Video Understanding
por: Yang, Jihan, et al.
Publicado: (2026)
por: Yang, Jihan, et al.
Publicado: (2026)
OmniGround: A Comprehensive Spatio-Temporal Grounding Benchmark for Real-World Complex Scenarios
por: Gao, Hong, et al.
Publicado: (2025)
por: Gao, Hong, et al.
Publicado: (2025)
VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement
por: Kuang, Zhengfei, et al.
Publicado: (2025)
por: Kuang, Zhengfei, et al.
Publicado: (2025)
SIMS-V: Simulated Instruction-Tuning for Spatial Video Understanding
por: Brown, Ellis, et al.
Publicado: (2025)
por: Brown, Ellis, et al.
Publicado: (2025)
Groma: Localized Visual Tokenization for Grounding Multimodal Large Language Models
por: Ma, Chuofan, et al.
Publicado: (2024)
por: Ma, Chuofan, et al.
Publicado: (2024)
Science-T2I: Addressing Scientific Illusions in Image Synthesis
por: Li, Jialuo, et al.
Publicado: (2025)
por: Li, Jialuo, et al.
Publicado: (2025)
ViaRL: Adaptive Temporal Grounding via Visual Iterated Amplification Reinforcement Learning
por: Xu, Ziqiang, et al.
Publicado: (2025)
por: Xu, Ziqiang, et al.
Publicado: (2025)
BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections
por: Varghese, Subin, et al.
Publicado: (2025)
por: Varghese, Subin, et al.
Publicado: (2025)
Texture-Preserving Diffusion Models for High-Fidelity Virtual Try-On
por: Yang, Xu, et al.
Publicado: (2024)
por: Yang, Xu, et al.
Publicado: (2024)
Data Pruning by Information Maximization
por: Tan, Haoru, et al.
Publicado: (2025)
por: Tan, Haoru, et al.
Publicado: (2025)
Detection of On-Ground Chestnuts Using Artificial Intelligence Toward Automated Picking
por: Fang, Kaixuan, et al.
Publicado: (2026)
por: Fang, Kaixuan, et al.
Publicado: (2026)
Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders
por: Tong, Shengbang, et al.
Publicado: (2026)
por: Tong, Shengbang, et al.
Publicado: (2026)
Augmented Commonsense Knowledge for Remote Object Grounding
por: Mohammadi, Bahram, et al.
Publicado: (2024)
por: Mohammadi, Bahram, et al.
Publicado: (2024)
PhyT2V: LLM-Guided Iterative Self-Refinement for Physics-Grounded Text-to-Video Generation
por: Xue, Qiyao, et al.
Publicado: (2024)
por: Xue, Qiyao, et al.
Publicado: (2024)
Lesion-Aware Generative Artificial Intelligence for Virtual Contrast-Enhanced Mammography in Breast Cancer
por: Rofena, Aurora, et al.
Publicado: (2025)
por: Rofena, Aurora, et al.
Publicado: (2025)
VideoMiner: Iteratively Grounding Key Frames of Hour-Long Videos via Tree-based Group Relative Policy Optimization
por: Cao, Xinye, et al.
Publicado: (2025)
por: Cao, Xinye, et al.
Publicado: (2025)
Transition Matching Distillation for Fast Video Generation
por: Nie, Weili, et al.
Publicado: (2026)
por: Nie, Weili, et al.
Publicado: (2026)
DOGR: Towards Versatile Visual Document Grounding and Referring
por: Zhou, Yinan, et al.
Publicado: (2024)
por: Zhou, Yinan, et al.
Publicado: (2024)
Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models
por: Yu, Keunwoo Peter, et al.
Publicado: (2025)
por: Yu, Keunwoo Peter, et al.
Publicado: (2025)
AirV2X: Unified Air-Ground Vehicle-to-Everything Collaboration
por: Gao, Xiangbo, et al.
Publicado: (2025)
por: Gao, Xiangbo, et al.
Publicado: (2025)
Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding
por: Huy, Ta Duc, et al.
Publicado: (2025)
por: Huy, Ta Duc, et al.
Publicado: (2025)
Mastering Negation: Boosting Grounding Models via Grouped Opposition-Based Learning
por: Yang, Zesheng, et al.
Publicado: (2026)
por: Yang, Zesheng, et al.
Publicado: (2026)
Grounding Intelligence in Movement
por: Segado, Melanie, et al.
Publicado: (2025)
por: Segado, Melanie, et al.
Publicado: (2025)
Component-Aware Structure-Preserving Style Transfer for Satellite Visual Sim2Real Data Construction
por: Xie, Zongwu, et al.
Publicado: (2026)
por: Xie, Zongwu, et al.
Publicado: (2026)
SeqTex: Generate Mesh Textures in Video Sequence
por: Yuan, Ze, et al.
Publicado: (2025)
por: Yuan, Ze, et al.
Publicado: (2025)
Pareto-Enhanced Portrait Generation: Vision-Aligned Text Supervision for Alignment, Realism, and Aesthetics
por: Wang, Yunlong, et al.
Publicado: (2026)
por: Wang, Yunlong, et al.
Publicado: (2026)
Phi-Ground Tech Report: Advancing Perception in GUI Grounding
por: Zhang, Miaosen, et al.
Publicado: (2025)
por: Zhang, Miaosen, et al.
Publicado: (2025)
Towards Visual Discrimination and Reasoning of Real-World Physical Dynamics: Physics-Grounded Anomaly Detection
por: Li, Wenqiao, et al.
Publicado: (2025)
por: Li, Wenqiao, et al.
Publicado: (2025)
DiT-VTON: Diffusion Transformer Framework for Unified Multi-Category Virtual Try-On and Virtual Try-All with Integrated Image Editing
por: Li, Qi, et al.
Publicado: (2025)
por: Li, Qi, et al.
Publicado: (2025)
V-Zen: Efficient GUI Understanding and Precise Grounding With A Novel Multimodal LLM
por: Rahman, Abdur, et al.
Publicado: (2024)
por: Rahman, Abdur, et al.
Publicado: (2024)
ESCA: Enabling Seamless Codec Avatar Execution through Algorithm and Hardware Co-Optimization for Virtual Reality
por: Zhu, Mingzhi, et al.
Publicado: (2025)
por: Zhu, Mingzhi, et al.
Publicado: (2025)
ToG-Bench: Task-Oriented Spatio-Temporal Grounding in Egocentric Videos
por: Xu, Qi'ao, et al.
Publicado: (2025)
por: Xu, Qi'ao, et al.
Publicado: (2025)
Ejemplares similares
-
RegionPLC: Regional Point-Language Contrastive Learning for Open-World 3D Scene Understanding
por: Yang, Jihan, et al.
Publicado: (2023) -
Benchmark Designers Should "Train on the Test Set" to Expose Exploitable Non-Visual Shortcuts
por: Brown, Ellis, et al.
Publicado: (2025) -
Traveling Across Languages: Benchmarking Cross-Lingual Consistency in Multimodal LLMs
por: Wang, Hao, et al.
Publicado: (2025) -
UniTok: A Unified Tokenizer for Visual Generation and Understanding
por: Ma, Chuofan, et al.
Publicado: (2025) -
Visual IRL for Human-Like Robotic Manipulation
por: Asali, Ehsan, et al.
Publicado: (2024)