A Proxy Consistency Loss for Grounded Fusion of Earth Observation and Location Encoders
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Zhongying, Lane, Kevin, Cai, Levi, Karimzadeh, Morteza, Rolf, Esther |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Genealogy of Foundation Models in Remote Sensing
par: Lane, Kevin, et autres
Publié: (2025)
par: Lane, Kevin, et autres
Publié: (2025)
Performance and Generalizability Impacts of Incorporating Location Encoders into Deep Learning for Dynamic PM2.5 Estimation
par: Karimzadeh, Morteza, et autres
Publié: (2025)
par: Karimzadeh, Morteza, et autres
Publié: (2025)
A Simple and Effective Temporal Grounding Pipeline for Basketball Broadcast Footage
par: Harris, Levi
Publié: (2024)
par: Harris, Levi
Publié: (2024)
Enhancing Performance of Point Cloud Completion Networks with Consistency Loss
par: Wijaya, Kevin Tirta, et autres
Publié: (2024)
par: Wijaya, Kevin Tirta, et autres
Publié: (2024)
LocDiff: Identifying Locations on Earth by Diffusing in the Hilbert Space
par: Wang, Zhangyu, et autres
Publié: (2025)
par: Wang, Zhangyu, et autres
Publié: (2025)
MRFD: Multi-Region Fusion Decoding with Self-Consistency for Mitigating Hallucinations in LVLMs
par: Ge, Haonan, et autres
Publié: (2025)
par: Ge, Haonan, et autres
Publié: (2025)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
par: She, Yifei, et autres
Publié: (2025)
par: She, Yifei, et autres
Publié: (2025)
EarthSynth: Generating Informative Earth Observation with Diffusion Models
par: Pan, Jiancheng, et autres
Publié: (2025)
par: Pan, Jiancheng, et autres
Publié: (2025)
A Multimodal Intermediate Fusion Network with Manifold Learning for Stress Detection
par: Bodaghi, Morteza, et autres
Publié: (2024)
par: Bodaghi, Morteza, et autres
Publié: (2024)
UniFusion: Vision-Language Model as Unified Encoder in Image Generation
par: Li, Kevin, et autres
Publié: (2025)
par: Li, Kevin, et autres
Publié: (2025)
Locating Demographic Bias at the Attention-Head Level in CLIP's Vision Encoder
par: Yasser, Alaa, et autres
Publié: (2026)
par: Yasser, Alaa, et autres
Publié: (2026)
Improving Image Coding for Machines through Optimizing Encoder via Auxiliary Loss
par: Iino, Kei, et autres
Publié: (2024)
par: Iino, Kei, et autres
Publié: (2024)
SatCLIP: Global, General-Purpose Location Embeddings with Satellite Imagery
par: Klemmer, Konstantin, et autres
Publié: (2023)
par: Klemmer, Konstantin, et autres
Publié: (2023)
Trifuse: Enhancing Attention-Based GUI Grounding via Multimodal Fusion
par: Ma, Longhui, et autres
Publié: (2026)
par: Ma, Longhui, et autres
Publié: (2026)
TerraMind: Large-Scale Generative Multimodality for Earth Observation
par: Jakubik, Johannes, et autres
Publié: (2025)
par: Jakubik, Johannes, et autres
Publié: (2025)
Beyond the Visible: Multispectral Vision-Language Learning for Earth Observation
par: Marimo, Clive Tinashe, et autres
Publié: (2025)
par: Marimo, Clive Tinashe, et autres
Publié: (2025)
IC-EO: Interpretable Code-based assistant for Earth Observation
par: Lahouel, Lamia, et autres
Publié: (2026)
par: Lahouel, Lamia, et autres
Publié: (2026)
FlowEO: Generative Unsupervised Domain Adaptation for Earth Observation
par: Bellier, Georges Le, et autres
Publié: (2025)
par: Bellier, Georges Le, et autres
Publié: (2025)
An Innovative Framework for Breast Cancer Detection Using Pyramid Adaptive Atrous Convolution, Transformer Integration, and Multi-Scale Feature Fusion
par: Pour, Ehsan Sadeghi, et autres
Publié: (2026)
par: Pour, Ehsan Sadeghi, et autres
Publié: (2026)
Seeking Consistent Flat Minima for Better Domain Generalization via Refining Loss Landscapes
par: Li, Aodi, et autres
Publié: (2024)
par: Li, Aodi, et autres
Publié: (2024)
Multi-task Visual Grounding with Coarse-to-Fine Consistency Constraints
par: Dai, Ming, et autres
Publié: (2025)
par: Dai, Ming, et autres
Publié: (2025)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
par: Chen, Jiuhai, et autres
Publié: (2024)
par: Chen, Jiuhai, et autres
Publié: (2024)
Zoom-shot: Fast and Efficient Unsupervised Zero-Shot Transfer of CLIP to Vision Encoders with Multimodal Loss
par: Shipard, Jordan, et autres
Publié: (2024)
par: Shipard, Jordan, et autres
Publié: (2024)
Deformable Image Registration with Multi-scale Feature Fusion from Shared Encoder, Auxiliary and Pyramid Decoders
par: Zhou, Hongchao, et autres
Publié: (2024)
par: Zhou, Hongchao, et autres
Publié: (2024)
Cross-aware Early Fusion with Stage-divided Vision and Language Transformer Encoders for Referring Image Segmentation
par: Cho, Yubin, et autres
Publié: (2024)
par: Cho, Yubin, et autres
Publié: (2024)
BotaCLIP: Contrastive Learning for Botany-Aware Representation of Earth Observation Data
par: Cerna, Selene, et autres
Publié: (2025)
par: Cerna, Selene, et autres
Publié: (2025)
Efficient Self-Supervised Learning for Earth Observation via Dynamic Dataset Curation
par: Kerdreux, Thomas, et autres
Publié: (2025)
par: Kerdreux, Thomas, et autres
Publié: (2025)
Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders
par: Lee, Dohun, et autres
Publié: (2025)
par: Lee, Dohun, et autres
Publié: (2025)
Investigating Redundancy in Multimodal Large Language Models with Multiple Vision Encoders
par: Wang, Yizhou, et autres
Publié: (2025)
par: Wang, Yizhou, et autres
Publié: (2025)
Real-Time Blind Defocus Deblurring for Earth Observation: The IMAGIN-e Mission Approach
par: Mousist, Alejandro D.
Publié: (2025)
par: Mousist, Alejandro D.
Publié: (2025)
On the Generalization of Representation Uncertainty in Earth Observation
par: Kondylatos, Spyros, et autres
Publié: (2025)
par: Kondylatos, Spyros, et autres
Publié: (2025)
Sparse BEV Fusion with Self-View Consistency for Multi-View Detection and Tracking
par: Toida, Keisuke, et autres
Publié: (2025)
par: Toida, Keisuke, et autres
Publié: (2025)
Collaborative Attention and Consistent-Guided Fusion of MRI and PET for Alzheimer's Disease Diagnosis
par: Ma, Delin, et autres
Publié: (2025)
par: Ma, Delin, et autres
Publié: (2025)
Zoom Consistency: A Free Confidence Signal in Multi-Step Visual Grounding Pipelines
par: Kim, Keon, et autres
Publié: (2026)
par: Kim, Keon, et autres
Publié: (2026)
SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs
par: Alansari, Mohamad, et autres
Publié: (2026)
par: Alansari, Mohamad, et autres
Publié: (2026)
GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification
par: Quang, Ngoc Bui Lam, et autres
Publié: (2025)
par: Quang, Ngoc Bui Lam, et autres
Publié: (2025)
SP$^2$T: Sparse Proxy Attention for Dual-stream Point Transformer
par: Wan, Jiaxu, et autres
Publié: (2024)
par: Wan, Jiaxu, et autres
Publié: (2024)
Multi Loss-based Feature Fusion and Top Two Voting Ensemble Decision Strategy for Facial Expression Recognition in the Wild
par: Zhou, Guangyao, et autres
Publié: (2023)
par: Zhou, Guangyao, et autres
Publié: (2023)
LocateBench: Evaluating the Locating Ability of Vision Language Models
par: Chiang, Ting-Rui, et autres
Publié: (2024)
par: Chiang, Ting-Rui, et autres
Publié: (2024)
Cross-Polarization Fusion of VV AND VH SAR Observations for Improved Flood Mapping
par: Talreja, Jagrati, et autres
Publié: (2026)
par: Talreja, Jagrati, et autres
Publié: (2026)
Documents similaires
-
A Genealogy of Foundation Models in Remote Sensing
par: Lane, Kevin, et autres
Publié: (2025) -
Performance and Generalizability Impacts of Incorporating Location Encoders into Deep Learning for Dynamic PM2.5 Estimation
par: Karimzadeh, Morteza, et autres
Publié: (2025) -
A Simple and Effective Temporal Grounding Pipeline for Basketball Broadcast Footage
par: Harris, Levi
Publié: (2024) -
Enhancing Performance of Point Cloud Completion Networks with Consistency Loss
par: Wijaya, Kevin Tirta, et autres
Publié: (2024) -
LocDiff: Identifying Locations on Earth by Diffusing in the Hilbert Space
par: Wang, Zhangyu, et autres
Publié: (2025)