Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
Fuente:
arXiv
Guardado en:
| Autores principales: | Park, Sungjune, Kim, Yeongyun, Kim, Se Yeon, Ro, Yong Man |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues
por: Park, Beomchan, et al.
Publicado: (2026)
por: Park, Beomchan, et al.
Publicado: (2026)
Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection
por: Park, Sungjune, et al.
Publicado: (2023)
por: Park, Sungjune, et al.
Publicado: (2023)
Robust Pedestrian Detection via Constructing Versatile Pedestrian Knowledge Bank
por: Park, Sungjune, et al.
Publicado: (2024)
por: Park, Sungjune, et al.
Publicado: (2024)
Robust Egocentric Visual Attention Prediction Through Language-guided Scene Context-aware Learning
por: Park, Sungjune, et al.
Publicado: (2026)
por: Park, Sungjune, et al.
Publicado: (2026)
Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images
por: Park, Sungjune, et al.
Publicado: (2025)
por: Park, Sungjune, et al.
Publicado: (2025)
Enhanced Vision-Language Models for Diverse Sensor Understanding: Cost-Efficient Optimization and Benchmarking
por: Chung, Sangyun, et al.
Publicado: (2024)
por: Chung, Sangyun, et al.
Publicado: (2024)
DIP-R1: Deep Inspection and Perception with RL Looking Through and Understanding Complex Scenes
por: Park, Sungjune, et al.
Publicado: (2025)
por: Park, Sungjune, et al.
Publicado: (2025)
What if...?: Thinking Counterfactual Keywords Helps to Mitigate Hallucination in Large Multi-modal Models
por: Kim, Junho, et al.
Publicado: (2024)
por: Kim, Junho, et al.
Publicado: (2024)
Meteor: Mamba-based Traversal of Rationale for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
MoAI: Mixture of All Intelligence for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Phantom of Latent for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models
por: Kim, Hayeon, et al.
Publicado: (2026)
por: Kim, Hayeon, et al.
Publicado: (2026)
CoLLaVO: Crayon Large Language and Vision mOdel
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Empathetic Response in Audio-Visual Conversations Using Emotion Preference Optimization and MambaCompressor
por: Kim, Yeonju, et al.
Publicado: (2024)
por: Kim, Yeonju, et al.
Publicado: (2024)
SPARK: Multi-Vision Sensor Perception and Reasoning Benchmark for Large-scale Vision-Language Models
por: Yu, Youngjoon, et al.
Publicado: (2024)
por: Yu, Youngjoon, et al.
Publicado: (2024)
CODE: Contrasting Self-generated Description to Combat Hallucination in Large Multi-modal Models
por: Kim, Junho, et al.
Publicado: (2024)
por: Kim, Junho, et al.
Publicado: (2024)
TroL: Traversal of Layers for Large Language and Vision Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
Causal Unsupervised Semantic Segmentation
por: Kim, Junho, et al.
Publicado: (2023)
por: Kim, Junho, et al.
Publicado: (2023)
Text-driven Talking Face Synthesis by Reprogramming Audio-driven Models
por: Choi, Jeongsoo, et al.
Publicado: (2023)
por: Choi, Jeongsoo, et al.
Publicado: (2023)
Revisiting Misalignment in Multispectral Pedestrian Detection: A Language-Driven Approach for Cross-modal Alignment Fusion
por: Kim, Taeheon, et al.
Publicado: (2024)
por: Kim, Taeheon, et al.
Publicado: (2024)
GCAgent: Long-Video Understanding via Schematic and Narrative Episodic Memory
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
RS3Mamba: Visual State Space Model for Remote Sensing Images Semantic Segmentation
por: Ma, Xianping, et al.
Publicado: (2024)
por: Ma, Xianping, et al.
Publicado: (2024)
Semantic Alignment for Multimodal Large Language Models
por: Wu, Tao, et al.
Publicado: (2024)
por: Wu, Tao, et al.
Publicado: (2024)
Semantics-aware Motion Retargeting with Vision-Language Models
por: Zhang, Haodong, et al.
Publicado: (2023)
por: Zhang, Haodong, et al.
Publicado: (2023)
Vision-Language Model Purified Semi-Supervised Semantic Segmentation for Remote Sensing Images
por: Wang, Shanwen, et al.
Publicado: (2026)
por: Wang, Shanwen, et al.
Publicado: (2026)
A Semantically Disentangled Unified Model for Multi-category 3D Anomaly Detection
por: Kim, SuYeon, et al.
Publicado: (2026)
por: Kim, SuYeon, et al.
Publicado: (2026)
Kolmogorov-Arnold Network for Remote Sensing Image Semantic Segmentation
por: Ma, Xianping, et al.
Publicado: (2025)
por: Ma, Xianping, et al.
Publicado: (2025)
AV2AV: Direct Audio-Visual Speech to Audio-Visual Speech Translation with Unified Audio-Visual Speech Representation
por: Choi, Jeongsoo, et al.
Publicado: (2023)
por: Choi, Jeongsoo, et al.
Publicado: (2023)
Beyond Semantics: Disentangling Information Scope in Sparse Autoencoders for CLIP
por: Ro, Yusung, et al.
Publicado: (2026)
por: Ro, Yusung, et al.
Publicado: (2026)
Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
por: Yeo, Jeong Hun, et al.
Publicado: (2025)
VLsI: Verbalized Layers-to-Interactions from Large to Small Vision Language Models
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
por: Lee, Byung-Kwan, et al.
Publicado: (2024)
HalLoc: Token-level Localization of Hallucinations for Vision Language Models
por: Park, Eunkyu, et al.
Publicado: (2025)
por: Park, Eunkyu, et al.
Publicado: (2025)
ESREAL: Exploiting Semantic Reconstruction to Mitigate Hallucinations in Vision-Language Models
por: Kim, Minchan, et al.
Publicado: (2024)
por: Kim, Minchan, et al.
Publicado: (2024)
Remote Sensing SpatioTemporal Vision-Language Models: A Comprehensive Survey
por: Liu, Chenyang, et al.
Publicado: (2024)
por: Liu, Chenyang, et al.
Publicado: (2024)
CrossEarth: Geospatial Vision Foundation Model for Domain Generalizable Remote Sensing Semantic Segmentation
por: Gong, Ziyang, et al.
Publicado: (2024)
por: Gong, Ziyang, et al.
Publicado: (2024)
A Unified Framework with Multimodal Fine-tuning for Remote Sensing Semantic Segmentation
por: Ma, Xianping, et al.
Publicado: (2024)
por: Ma, Xianping, et al.
Publicado: (2024)
SeG-SR: Integrating Semantic Knowledge into Remote Sensing Image Super-Resolution via Vision-Language Model
por: Chen, Bowen, et al.
Publicado: (2025)
por: Chen, Bowen, et al.
Publicado: (2025)
MSCoTDet: Language-driven Multi-modal Fusion for Improved Multispectral Pedestrian Detection
por: Kim, Taeheon, et al.
Publicado: (2024)
por: Kim, Taeheon, et al.
Publicado: (2024)
CHOICE: Benchmarking the Remote Sensing Capabilities of Large Vision-Language Models
por: An, Xiao, et al.
Publicado: (2024)
por: An, Xiao, et al.
Publicado: (2024)
Decomposition-based Unsupervised Domain Adaptation for Remote Sensing Image Semantic Segmentation
por: Ma, Xianping, et al.
Publicado: (2024)
por: Ma, Xianping, et al.
Publicado: (2024)
Ejemplares similares
-
Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues
por: Park, Beomchan, et al.
Publicado: (2026) -
Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection
por: Park, Sungjune, et al.
Publicado: (2023) -
Robust Pedestrian Detection via Constructing Versatile Pedestrian Knowledge Bank
por: Park, Sungjune, et al.
Publicado: (2024) -
Robust Egocentric Visual Attention Prediction Through Language-guided Scene Context-aware Learning
por: Park, Sungjune, et al.
Publicado: (2026) -
Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images
por: Park, Sungjune, et al.
Publicado: (2025)