Salvato in:
| Autori principali: | Tang, Xuejiao, Zhang, Wenbin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2022
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2204.08027 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
di: He, Ziyao, et al.
Pubblicazione: (2026)
di: He, Ziyao, et al.
Pubblicazione: (2026)
SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding
di: Zeng, Nianbo, et al.
Pubblicazione: (2025)
di: Zeng, Nianbo, et al.
Pubblicazione: (2025)
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
di: Chen, Yixin, et al.
Pubblicazione: (2026)
di: Chen, Yixin, et al.
Pubblicazione: (2026)
HAMF: A Hybrid Attention-Mamba Framework for Joint Scene Context Understanding and Future Motion Representation Learning
di: Mei, Xiaodong, et al.
Pubblicazione: (2025)
di: Mei, Xiaodong, et al.
Pubblicazione: (2025)
TopoLogic: An Interpretable Pipeline for Lane Topology Reasoning on Driving Scenes
di: Fu, Yanping, et al.
Pubblicazione: (2024)
di: Fu, Yanping, et al.
Pubblicazione: (2024)
Towards Holistic Surgical Scene Understanding
di: Valderrama, Natalia, et al.
Pubblicazione: (2022)
di: Valderrama, Natalia, et al.
Pubblicazione: (2022)
Fine-Grained Scene Graph Generation via Sample-Level Bias Prediction
di: Li, Yansheng, et al.
Pubblicazione: (2024)
di: Li, Yansheng, et al.
Pubblicazione: (2024)
Heat Diffusion Models -- Interpixel Attention Mechanism
di: Zhang, Pengfei, et al.
Pubblicazione: (2025)
di: Zhang, Pengfei, et al.
Pubblicazione: (2025)
RieMind: Geometry-Grounded Spatial Agent for Scene Understanding
di: Ropero, Fernando, et al.
Pubblicazione: (2026)
di: Ropero, Fernando, et al.
Pubblicazione: (2026)
Toward Robust Multimodal Learning using Multimodal Foundational Models
di: Zhao, Xianbing, et al.
Pubblicazione: (2024)
di: Zhao, Xianbing, et al.
Pubblicazione: (2024)
3D-RFT: Reinforcement Fine-Tuning for Video-based 3D Scene Understanding
di: Linghu, Xiongkun, et al.
Pubblicazione: (2026)
di: Linghu, Xiongkun, et al.
Pubblicazione: (2026)
Response-G1: Explicit Scene Graph Modeling for Proactive Streaming Video Understanding
di: Ma, Ke, et al.
Pubblicazione: (2026)
di: Ma, Ke, et al.
Pubblicazione: (2026)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
di: Li, Haoyuan, et al.
Pubblicazione: (2025)
Can Large Multimodal Models Understand Agricultural Scenes? Benchmarking with AgroMind
di: Li, Qingmei, et al.
Pubblicazione: (2025)
di: Li, Qingmei, et al.
Pubblicazione: (2025)
Evaluating Compositional Scene Understanding in Multimodal Generative Models
di: Fu, Shuhao, et al.
Pubblicazione: (2025)
di: Fu, Shuhao, et al.
Pubblicazione: (2025)
Solving Scene Understanding for Autonomous Navigation in Unstructured Environments
di: Renji, Naveen Mathews, et al.
Pubblicazione: (2025)
di: Renji, Naveen Mathews, et al.
Pubblicazione: (2025)
DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation
di: Wang, Zirui, et al.
Pubblicazione: (2025)
di: Wang, Zirui, et al.
Pubblicazione: (2025)
MASR: Self-Reflective Reasoning through Multimodal Hierarchical Attention Focusing for Agent-based Video Understanding
di: Cao, Shiwen, et al.
Pubblicazione: (2025)
di: Cao, Shiwen, et al.
Pubblicazione: (2025)
MTMamba: Enhancing Multi-Task Dense Scene Understanding by Mamba-Based Decoders
di: Lin, Baijiong, et al.
Pubblicazione: (2024)
di: Lin, Baijiong, et al.
Pubblicazione: (2024)
Trustworthy Automated Driving through Qualitative Scene Understanding and Explanations
di: Belmecheri, Nassim, et al.
Pubblicazione: (2024)
di: Belmecheri, Nassim, et al.
Pubblicazione: (2024)
HexPlane Representation for 3D Semantic Scene Understanding
di: Chen, Zeren, et al.
Pubblicazione: (2025)
di: Chen, Zeren, et al.
Pubblicazione: (2025)
PerspectiveNet: Multi-View Perception for Dynamic Scene Understanding
di: Nguyen, Vinh
Pubblicazione: (2024)
di: Nguyen, Vinh
Pubblicazione: (2024)
DOCTR: Disentangled Object-Centric Transformer for Point Scene Understanding
di: Yu, Xiaoxuan, et al.
Pubblicazione: (2024)
di: Yu, Xiaoxuan, et al.
Pubblicazione: (2024)
Masked Scene Modeling: Narrowing the Gap Between Supervised and Self-Supervised Learning in 3D Scene Understanding
di: Hermosilla, Pedro, et al.
Pubblicazione: (2025)
di: Hermosilla, Pedro, et al.
Pubblicazione: (2025)
Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs
di: Wang, Wei-Yao, et al.
Pubblicazione: (2025)
di: Wang, Wei-Yao, et al.
Pubblicazione: (2025)
Learning to Look: Cognitive Attention Alignment with Vision-Language Models
di: Yang, Ryan L., et al.
Pubblicazione: (2025)
di: Yang, Ryan L., et al.
Pubblicazione: (2025)
An Efficient Aerial Image Detection with Variable Receptive Fields
di: Wenbin, Liu
Pubblicazione: (2025)
di: Wenbin, Liu
Pubblicazione: (2025)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
di: Liu, Hanqing, et al.
Pubblicazione: (2026)
di: Liu, Hanqing, et al.
Pubblicazione: (2026)
Cognitive Mismatch in Multimodal Large Language Models for Discrete Symbol Understanding
di: Li, Yinghui, et al.
Pubblicazione: (2026)
di: Li, Yinghui, et al.
Pubblicazione: (2026)
Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
di: Xu, Yifan, et al.
Pubblicazione: (2025)
di: Xu, Yifan, et al.
Pubblicazione: (2025)
Enhancing Human-Centered Dynamic Scene Understanding via Multiple LLMs Collaborated Reasoning
di: Zhang, Hang, et al.
Pubblicazione: (2024)
di: Zhang, Hang, et al.
Pubblicazione: (2024)
Towards Unified Surgical Scene Understanding:Bridging Reasoning and Grounding via MLLMs
di: Huang, Jincai, et al.
Pubblicazione: (2026)
di: Huang, Jincai, et al.
Pubblicazione: (2026)
Hierarchical Question-Answering for Driving Scene Understanding Using Vision-Language Models
di: Mohamud, Safaa Abdullahi Moallim, et al.
Pubblicazione: (2025)
di: Mohamud, Safaa Abdullahi Moallim, et al.
Pubblicazione: (2025)
Towards Comprehensive Scene Understanding: Integrating First and Third-Person Views for LVLMs
di: Lee, Insu, et al.
Pubblicazione: (2025)
di: Lee, Insu, et al.
Pubblicazione: (2025)
Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning
di: Fu, Rao, et al.
Pubblicazione: (2024)
di: Fu, Rao, et al.
Pubblicazione: (2024)
CogME: A Cognition-Inspired Multi-Dimensional Evaluation Metric for Story Understanding
di: Shin, Minjung, et al.
Pubblicazione: (2021)
di: Shin, Minjung, et al.
Pubblicazione: (2021)
Attention over Scene Graphs: Indoor Scene Representations Toward CSAI Classification
di: Barros, Artur, et al.
Pubblicazione: (2025)
di: Barros, Artur, et al.
Pubblicazione: (2025)
EventSTR: A Benchmark Dataset and Baselines for Event Stream based Scene Text Recognition
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
NuScenes-SpatialQA: A Spatial Understanding and Reasoning Benchmark for Vision-Language Models in Autonomous Driving
di: Tian, Kexin, et al.
Pubblicazione: (2025)
di: Tian, Kexin, et al.
Pubblicazione: (2025)
Attention at Rest Stays at Rest: Breaking Visual Inertia for Cognitive Hallucination Mitigation
di: Gong, Boyang, et al.
Pubblicazione: (2026)
di: Gong, Boyang, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
di: He, Ziyao, et al.
Pubblicazione: (2026) -
SceneRAG: Scene-level Retrieval-Augmented Generation for Video Understanding
di: Zeng, Nianbo, et al.
Pubblicazione: (2025) -
Lifting Unlabeled Internet-level Data for 3D Scene Understanding
di: Chen, Yixin, et al.
Pubblicazione: (2026) -
HAMF: A Hybrid Attention-Mamba Framework for Joint Scene Context Understanding and Future Motion Representation Learning
di: Mei, Xiaodong, et al.
Pubblicazione: (2025) -
TopoLogic: An Interpretable Pipeline for Lane Topology Reasoning on Driving Scenes
di: Fu, Yanping, et al.
Pubblicazione: (2024)