Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation
Fuente:
arXiv
Salvato in:
| Autori principali: | Jin, Kaiming, Wu, Yuefan, Wu, Shengqiong, Li, Bobo, Yan, Shuicheng, Chua, Tat-Seng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Universal Scene Graph Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
di: Fei, Hao, et al.
Pubblicazione: (2024)
di: Fei, Hao, et al.
Pubblicazione: (2024)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
di: Fei, Hao, et al.
Pubblicazione: (2024)
di: Fei, Hao, et al.
Pubblicazione: (2024)
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
Modeling Cross-vision Synergy for Unified Large Vision Model
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
di: Fei, Hao, et al.
Pubblicazione: (2023)
di: Fei, Hao, et al.
Pubblicazione: (2023)
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
di: Jin, Zhe, et al.
Pubblicazione: (2025)
di: Jin, Zhe, et al.
Pubblicazione: (2025)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
di: Liu, Kai, et al.
Pubblicazione: (2025)
di: Liu, Kai, et al.
Pubblicazione: (2025)
A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
di: Wang, Yaoting, et al.
Pubblicazione: (2025)
Auto-Encoding Morph-Tokens for Multimodal LLM
di: Pan, Kaihang, et al.
Pubblicazione: (2024)
di: Pan, Kaihang, et al.
Pubblicazione: (2024)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
di: Chu, Meng, et al.
Pubblicazione: (2025)
di: Chu, Meng, et al.
Pubblicazione: (2025)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
Orthogonal Spatial-temporal Distributional Transfer for 4D Generation
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
OMG-LLaVA: Bridging Image-level, Object-level, Pixel-level Reasoning and Understanding
di: Zhang, Tao, et al.
Pubblicazione: (2024)
di: Zhang, Tao, et al.
Pubblicazione: (2024)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
di: Liang, Zhengyang, et al.
Pubblicazione: (2025)
di: Liang, Zhengyang, et al.
Pubblicazione: (2025)
Scene-Text Grounding for Text-Based Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
di: Zhang, An, et al.
Pubblicazione: (2024)
di: Zhang, An, et al.
Pubblicazione: (2024)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark
di: Miao, Bingchen, et al.
Pubblicazione: (2025)
di: Miao, Bingchen, et al.
Pubblicazione: (2025)
Multiple-environment Self-adaptive Network for Aerial-view Geo-localization
di: Wang, Tingyu, et al.
Pubblicazione: (2022)
di: Wang, Tingyu, et al.
Pubblicazione: (2022)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective
di: Zheng, Zhedong, et al.
Pubblicazione: (2022)
di: Zheng, Zhedong, et al.
Pubblicazione: (2022)
Global-Local Aware Scene Text Editing
di: Yang, Fuxiang, et al.
Pubblicazione: (2025)
di: Yang, Fuxiang, et al.
Pubblicazione: (2025)
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
di: Qian, Long, et al.
Pubblicazione: (2024)
di: Qian, Long, et al.
Pubblicazione: (2024)
Suppressing Forgery-Specific Shortcuts for Generalizable Deepfake Detection
di: Wang, Yihui, et al.
Pubblicazione: (2026)
di: Wang, Yihui, et al.
Pubblicazione: (2026)
Latent Anomaly Knowledge Excavation: Unveiling Sparse Sensitive Neurons in Vision-Language Models
di: Li, Shaotian, et al.
Pubblicazione: (2026)
di: Li, Shaotian, et al.
Pubblicazione: (2026)
Dual-Stream Global-Local Feature Collaborative Representation Network for Scene Classification of Mining Area
di: Fan, Shuqi, et al.
Pubblicazione: (2025)
di: Fan, Shuqi, et al.
Pubblicazione: (2025)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
di: Chu, Meng, et al.
Pubblicazione: (2023)
di: Chu, Meng, et al.
Pubblicazione: (2023)
Benchmarking Multimodal CoT Reward Model Stepwise by Visual Program
di: Gao, Minghe, et al.
Pubblicazione: (2025)
di: Gao, Minghe, et al.
Pubblicazione: (2025)
Show Me What and Where has Changed? Question Answering and Grounding for Remote Sensing Change Detection
di: Li, Ke, et al.
Pubblicazione: (2024)
di: Li, Ke, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Universal Scene Graph Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025) -
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
di: Fei, Hao, et al.
Pubblicazione: (2024) -
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
di: Fei, Hao, et al.
Pubblicazione: (2024) -
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
di: Wu, Shengqiong, et al.
Pubblicazione: (2024) -
Towards Semantic Equivalence of Tokenization in Multimodal LLM
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)