Robust Grounding with MLLMs Against Occlusion and Small Objects via Language-Guided Semantic Cues
Fuente:
arXiv
Saved in:
| Main Authors: | Park, Beomchan, Kim, Seongho, Kim, Hyunjun, Park, Sungjune, Ro, Yong Man |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images
by: Park, Sungjune, et al.
Published: (2025)
by: Park, Sungjune, et al.
Published: (2025)
Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio
by: Yeo, Jeong Hun, et al.
Published: (2025)
by: Yeo, Jeong Hun, et al.
Published: (2025)
Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection
by: Park, Sungjune, et al.
Published: (2023)
by: Park, Sungjune, et al.
Published: (2023)
Personalized Lip Reading: Adapting to Your Unique Lip Movements with Vision and Language
by: Yeo, Jeong Hun, et al.
Published: (2024)
by: Yeo, Jeong Hun, et al.
Published: (2024)
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation
by: Park, Se Jin, et al.
Published: (2023)
by: Park, Se Jin, et al.
Published: (2023)
Robust Pedestrian Detection via Constructing Versatile Pedestrian Knowledge Bank
by: Park, Sungjune, et al.
Published: (2024)
by: Park, Sungjune, et al.
Published: (2024)
DIP-R1: Deep Inspection and Perception with RL Looking Through and Understanding Complex Scenes
by: Park, Sungjune, et al.
Published: (2025)
by: Park, Sungjune, et al.
Published: (2025)
Where Visual Speech Meets Language: VSP-LLM Framework for Efficient and Context-Aware Visual Speech Processing
by: Yeo, Jeong Hun, et al.
Published: (2024)
by: Yeo, Jeong Hun, et al.
Published: (2024)
Lip Reading for Low-resource Languages by Learning and Combining General Speech Knowledge and Language-specific Knowledge
by: Kim, Minsu, et al.
Published: (2023)
by: Kim, Minsu, et al.
Published: (2023)
Prompt Tuning of Deep Neural Networks for Speaker-adaptive Visual Speech Recognition
by: Kim, Minsu, et al.
Published: (2023)
by: Kim, Minsu, et al.
Published: (2023)
AKVSR: Audio Knowledge Empowered Visual Speech Recognition by Compressing Audio Knowledge of a Pretrained Model
by: Yeo, Jeong Hun, et al.
Published: (2023)
by: Yeo, Jeong Hun, et al.
Published: (2023)
Iterative Occlusion-Aware Light Field Depth Estimation using 4D Geometrical Cues
by: Lourenço, Rui, et al.
Published: (2024)
by: Lourenço, Rui, et al.
Published: (2024)
Domain Aware Multi-Task Pretraining of 3D Swin Transformer for T1-weighted Brain MRI
by: Kim, Jonghun, et al.
Published: (2024)
by: Kim, Jonghun, et al.
Published: (2024)
Radiomics-guided Multimodal Self-attention Network for Predicting Pathological Complete Response in Breast MRI
by: Kim, Jonghun, et al.
Published: (2024)
by: Kim, Jonghun, et al.
Published: (2024)
Adaptive Latent Diffusion Model for 3D Medical Image to Image Translation: Multi-modal Magnetic Resonance Imaging Study
by: Kim, Jonghun, et al.
Published: (2023)
by: Kim, Jonghun, et al.
Published: (2023)
Introducing VaDA: Novel Image Segmentation Model for Maritime Object Segmentation Using New Dataset
by: Kim, Yongjin, et al.
Published: (2024)
by: Kim, Yongjin, et al.
Published: (2024)
RICAU-Net: Residual-block Inspired Coordinate Attention U-Net for Segmentation of Small and Sparse Calcium Lesions in Cardiac CT
by: Park, Doyoung, et al.
Published: (2024)
by: Park, Doyoung, et al.
Published: (2024)
Aberration Correcting Vision Transformers for High-Fidelity Metalens Imaging
by: Lee, Byeonghyeon, et al.
Published: (2024)
by: Lee, Byeonghyeon, et al.
Published: (2024)
Challenges and Lessons from MIDOG 2025: A Two-Stage Approach to Domain-Robust Mitotic Figure Detection
by: Song, Euiseop, et al.
Published: (2025)
by: Song, Euiseop, et al.
Published: (2025)
COMPASS: High-Efficiency Deep Image Compression with Arbitrary-scale Spatial Scalability
by: Park, Jongmin, et al.
Published: (2023)
by: Park, Jongmin, et al.
Published: (2023)
Improving Editability in Image Generation with Layer-wise Memory
by: Kim, Daneul, et al.
Published: (2025)
by: Kim, Daneul, et al.
Published: (2025)
WINE: Wavelet-Guided GAN Inversion and Editing for High-Fidelity Refinement
by: Kim, Chaewon, et al.
Published: (2022)
by: Kim, Chaewon, et al.
Published: (2022)
C-DiffSET: Leveraging Latent Diffusion for SAR-to-EO Image Translation with Confidence-Guided Reliable Object Generation
by: Do, Jeonghyeok, et al.
Published: (2024)
by: Do, Jeonghyeok, et al.
Published: (2024)
Talk2SAM: Text-Guided Semantic Enhancement for Complex-Shaped Object Segmentation
by: Vetoshkin, Luka, et al.
Published: (2025)
by: Vetoshkin, Luka, et al.
Published: (2025)
Privacy-Preserving Chest X-ray Classification in Latent Space with Homomorphically Encrypted Neural Inference
by: Kim, Jonghun, et al.
Published: (2025)
by: Kim, Jonghun, et al.
Published: (2025)
Small Drone Classification with Light CNN and New Micro-Doppler Signature Extraction Method Based on A-SPC Technique
by: Park, Junhyeong, et al.
Published: (2020)
by: Park, Junhyeong, et al.
Published: (2020)
CSI-Inpainter: Enabling Visual Scene Recovery from CSI Time Sequences for Occlusion Removal
by: Chen, Cheng, et al.
Published: (2023)
by: Chen, Cheng, et al.
Published: (2023)
Coarse-to-Fine: Progressive Image Compression for Semantically Hierarchical Classification
by: Kim, Jungwoo, et al.
Published: (2026)
by: Kim, Jungwoo, et al.
Published: (2026)
Moiré Zero: An Efficient and High-Performance Neural Architecture for Moiré Removal
by: Lee, Seungryong, et al.
Published: (2025)
by: Lee, Seungryong, et al.
Published: (2025)
FluoCLIP: Stain-Aware Focus Quality Assessment in Fluorescence Microscopy
by: Park, Hyejin, et al.
Published: (2026)
by: Park, Hyejin, et al.
Published: (2026)
Flow-Assisted Motion Learning Network for Weakly-Supervised Group Activity Recognition
by: Nugroho, Muhammad Adi, et al.
Published: (2024)
by: Nugroho, Muhammad Adi, et al.
Published: (2024)
VideoSPatS: Video SPatiotemporal Splines for Disentangled Occlusion, Appearance and Motion Modeling and Editing
by: Bello, Juan Luis Gonzalez, et al.
Published: (2025)
by: Bello, Juan Luis Gonzalez, et al.
Published: (2025)
Two-Stage Approach for Brain MR Image Synthesis: 2D Image Synthesis and 3D Refinement
by: Cho, Jihoon, et al.
Published: (2024)
by: Cho, Jihoon, et al.
Published: (2024)
M3CoTBench: Benchmark Chain-of-Thought of MLLMs in Medical Image Understanding
by: Jiang, Juntao, et al.
Published: (2026)
by: Jiang, Juntao, et al.
Published: (2026)
Fully Guided Neural Schrödinger bridge for Brain MR image synthesis
by: Yang, Hanyeol, et al.
Published: (2025)
by: Yang, Hanyeol, et al.
Published: (2025)
MedRegion-CT: Region-Focused Multimodal LLM for Comprehensive 3D CT Report Generation
by: Kyung, Sunggu, et al.
Published: (2025)
by: Kyung, Sunggu, et al.
Published: (2025)
Aerial Multi-View Stereo via Adaptive Depth Range Inference and Normal Cues
by: Liu, Yimei, et al.
Published: (2025)
by: Liu, Yimei, et al.
Published: (2025)
MEMO: Dataset and Methods for Robust Multimodal Retinal Image Registration with Large or Small Vessel Density Differences
by: Wang, Chiao-Yi, et al.
Published: (2023)
by: Wang, Chiao-Yi, et al.
Published: (2023)
Multi-resolution Guided 3D GANs for Medical Image Translation
by: Ha, Juhyung, et al.
Published: (2024)
by: Ha, Juhyung, et al.
Published: (2024)
Data-driven Precipitation Nowcasting Using Satellite Imagery
by: Park, Young-Jae, et al.
Published: (2024)
by: Park, Young-Jae, et al.
Published: (2024)
Similar Items
-
Language-guided Learning for Object Detection Tackling Multiple Variations in Aerial Images
by: Park, Sungjune, et al.
Published: (2025) -
Towards Inclusive Communication: A Unified Framework for Generating Spoken Language from Sign, Lip, and Audio
by: Yeo, Jeong Hun, et al.
Published: (2025) -
Integrating Language-Derived Appearance Elements with Visual Cues in Pedestrian Detection
by: Park, Sungjune, et al.
Published: (2023) -
Personalized Lip Reading: Adapting to Your Unique Lip Movements with Vision and Language
by: Yeo, Jeong Hun, et al.
Published: (2024) -
Exploring Phonetic Context-Aware Lip-Sync For Talking Face Generation
by: Park, Se Jin, et al.
Published: (2023)