Retrieval Augmented Generation and Understanding in Vision: A Survey and New Outlook
Fuente:
arXiv
Salvato in:
| Autori principali: | Zheng, Xu, Weng, Ziqiao, Lyu, Yuanhuiyi, Jiang, Lutao, Xue, Haiwei, Ren, Bin, Paudel, Danda, Sebe, Nicu, Van Gool, Luc, Hu, Xuming |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
di: Dongfang, Zihao, et al.
Pubblicazione: (2025)
PANORAMA: The Rise of Omnidirectional Vision in the Embodied AI Era
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation
di: Ma, Qi, et al.
Pubblicazione: (2025)
di: Ma, Qi, et al.
Pubblicazione: (2025)
Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
ShapeSplat: A Large-scale Dataset of Gaussian Splats and Their Self-Supervised Pretraining
di: Ma, Qi, et al.
Pubblicazione: (2024)
di: Ma, Qi, et al.
Pubblicazione: (2024)
EarthMind: Leveraging Cross-Sensor Data for Advanced Earth Observation Interpretation with a Unified Multimodal LLM
di: Shu, Yan, et al.
Pubblicazione: (2025)
di: Shu, Yan, et al.
Pubblicazione: (2025)
MLLMs are Deeply Affected by Modality Bias
di: Zheng, Xu, et al.
Pubblicazione: (2025)
di: Zheng, Xu, et al.
Pubblicazione: (2025)
Efficient Degradation-agnostic Image Restoration via Channel-Wise Functional Decomposition and Manifold Regularization
di: Ren, Bin, et al.
Pubblicazione: (2025)
di: Ren, Bin, et al.
Pubblicazione: (2025)
Bringing Masked Autoencoders Explicit Contrastive Properties for Point Cloud Self-Supervised Learning
di: Ren, Bin, et al.
Pubblicazione: (2024)
di: Ren, Bin, et al.
Pubblicazione: (2024)
StruVis: Enhancing Reasoning-based Text-to-Image Generation via Thinking with Structured Vision
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2026)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2026)
SceneSplat: Gaussian Splatting-based Scene Understanding with Vision-Language Pretraining
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Vision encoders should be image size agnostic and task driven
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2025)
Lego: Learning to Disentangle and Invert Personalized Concepts Beyond Object Appearance in Text-to-Image Diffusion Models
di: Motamed, Saman, et al.
Pubblicazione: (2023)
di: Motamed, Saman, et al.
Pubblicazione: (2023)
Autonomous Vehicle Controllers From End-to-End Differentiable Simulation
di: Nachkov, Asen, et al.
Pubblicazione: (2024)
di: Nachkov, Asen, et al.
Pubblicazione: (2024)
EvenNICER-SLAM: Event-based Neural Implicit Encoding SLAM
di: Chen, Shi, et al.
Pubblicazione: (2024)
di: Chen, Shi, et al.
Pubblicazione: (2024)
Enhanced Multi-Scale Cross-Attention for Person Image Generation
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
Graph Transformer GANs with Graph Masked Modeling for Architectural Layout Generation
di: Tang, Hao, et al.
Pubblicazione: (2024)
di: Tang, Hao, et al.
Pubblicazione: (2024)
Taming CLIP for Fine-grained and Structured Visual Understanding of Museum Exhibits
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
di: Balauca, Ada-Astrid, et al.
Pubblicazione: (2024)
Learning Robust Anymodal Segmentor with Unimodal and Cross-modal Distillation
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
Learning Generative Interactive Environments By Trained Agent Exploration
di: Kazemi, Naser, et al.
Pubblicazione: (2024)
di: Kazemi, Naser, et al.
Pubblicazione: (2024)
Any Image Restoration via Efficient Spatial-Frequency Degradation Adaptation
di: Ren, Bin, et al.
Pubblicazione: (2025)
di: Ren, Bin, et al.
Pubblicazione: (2025)
MAGIC++: Efficient and Resilient Modality-Agnostic Semantic Segmentation via Hierarchical Modality Selection
di: Zheng, Xu, et al.
Pubblicazione: (2024)
di: Zheng, Xu, et al.
Pubblicazione: (2024)
Implicit-Zoo: A Large-Scale Dataset of Neural Implicit Functions for 2D Images and 3D Scenes
di: Ma, Qi, et al.
Pubblicazione: (2024)
di: Ma, Qi, et al.
Pubblicazione: (2024)
Continuous Pose for Monocular Cameras in Neural Implicit Representation
di: Ma, Qi, et al.
Pubblicazione: (2023)
di: Ma, Qi, et al.
Pubblicazione: (2023)
From Synchrony to Sequence: Exo-to-Ego Generation via Interpolation
di: Mahdi, Mohammad, et al.
Pubblicazione: (2026)
di: Mahdi, Mohammad, et al.
Pubblicazione: (2026)
Self-supervised pretraining for an iterative image size agnostic vision transformer
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2026)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2026)
A Simple and Generalist Approach for Panoptic Segmentation
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2024)
di: Prisadnikov, Nedyalko, et al.
Pubblicazione: (2024)
Chorus: Multi-Teacher Pretraining for Holistic 3D Gaussian Scene Encoding
di: Li, Yue, et al.
Pubblicazione: (2025)
di: Li, Yue, et al.
Pubblicazione: (2025)
Understanding-in-Generation: Reinforcing Generative Capability of Unified Model via Infusing Understanding into Generation
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
RealRAG: Retrieval-augmented Realistic Image Generation via Self-reflective Contrastive Learning
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
di: Lyu, Yuanhuiyi, et al.
Pubblicazione: (2025)
Spatial-Temporal Graph Mamba for Music-Guided Dance Video Synthesis
di: Tang, Hao, et al.
Pubblicazione: (2025)
di: Tang, Hao, et al.
Pubblicazione: (2025)
From Scan to Action: Leveraging Realistic Scans for Embodied Scene Understanding
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
Inferring Compositional 4D Scenes without Ever Seeing One
di: Gokmen, Ahmet Berke, et al.
Pubblicazione: (2025)
di: Gokmen, Ahmet Berke, et al.
Pubblicazione: (2025)
RICO: Two Realistic Benchmarks and an In-Depth Analysis for Incremental Learning in Object Detection
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
Incremental Object Detection with Prompt-based Methods
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
di: Neuwirth-Trapp, Matthias, et al.
Pubblicazione: (2025)
Occam's LGS: An Efficient Approach for Language Gaussian Splatting
di: Cheng, Jiahuan, et al.
Pubblicazione: (2024)
di: Cheng, Jiahuan, et al.
Pubblicazione: (2024)
GaussianVLM: Scene-centric 3D Vision-Language Models using Language-aligned Gaussian Splats for Embodied Reasoning and Beyond
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
di: Halacheva, Anna-Maria, et al.
Pubblicazione: (2025)
SeasonScapes: Learning Large-scale Re-lightable 3D Landscapes with Seasonal Variation from Sparse Webcams
di: Kleger, Timo, et al.
Pubblicazione: (2026)
di: Kleger, Timo, et al.
Pubblicazione: (2026)
Ternary-Type Opacity and Hybrid Odometry for RGB NeRF-SLAM
di: Lin, Junru, et al.
Pubblicazione: (2023)
di: Lin, Junru, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Reducing Unimodal Bias in Multi-Modal Semantic Segmentation with Multi-Scale Functional Entropy Regularization
di: Zheng, Xu, et al.
Pubblicazione: (2025) -
Are Multimodal Large Language Models Ready for Omnidirectional Spatial Reasoning?
di: Dongfang, Zihao, et al.
Pubblicazione: (2025) -
PANORAMA: The Rise of Omnidirectional Vision in the Embodied AI Era
di: Zheng, Xu, et al.
Pubblicazione: (2025) -
CityLoc: 6DoF Pose Distributional Localization for Text Descriptions in Large-Scale Scenes with Gaussian Representation
di: Ma, Qi, et al.
Pubblicazione: (2025) -
Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks
di: Zheng, Xu, et al.
Pubblicazione: (2025)