Enregistré dans:
| Auteurs principaux: | Chen, Yuqi, Zhang, Xiaohan, Arrabi, Ahmad, Sultani, Waqas, Chen, Chen, Wshah, Safwan |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2604.10721 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Cross-View Meets Diffusion: Aerial Image Synthesis with Geometry and Text Guidance
par: Arrabi, Ahmad, et autres
Publié: (2024)
par: Arrabi, Ahmad, et autres
Publié: (2024)
GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Prediction
par: Lehyeh, Ayesh Abu, et autres
Publié: (2026)
par: Lehyeh, Ayesh Abu, et autres
Publié: (2026)
GeoDTR+: Toward generic cross-view geolocalization via geometric disentanglement
par: Zhang, Xiaohan, et autres
Publié: (2023)
par: Zhang, Xiaohan, et autres
Publié: (2023)
Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control
par: Jung, Jay, et autres
Publié: (2026)
par: Jung, Jay, et autres
Publié: (2026)
Geo$^\textbf{2}$: Geometry-Guided Cross-view Geo-Localization and Image Synthesis
par: Zhang, Yancheng, et autres
Publié: (2026)
par: Zhang, Yancheng, et autres
Publié: (2026)
Automated C-Arm Positioning via Conformal Landmark Localization
par: Arrabi, Ahmad, et autres
Publié: (2025)
par: Arrabi, Ahmad, et autres
Publié: (2025)
VICI: VLM-Instructed Cross-view Image-localisation
par: Zhang, Xiaohan, et autres
Publié: (2025)
par: Zhang, Xiaohan, et autres
Publié: (2025)
C-arm Guidance: A Self-supervised Approach To Automated Positioning During Stroke Thrombectomy
par: Arrabi, Ahmad, et autres
Publié: (2025)
par: Arrabi, Ahmad, et autres
Publié: (2025)
Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs
par: Zhang, Yi, et autres
Publié: (2025)
par: Zhang, Yi, et autres
Publié: (2025)
Seeing vs. Believing: Evaluating the Language Bias of Open-Source MLLMs in Counter-Intuitive Scenes
par: Ling, Chen, et autres
Publié: (2026)
par: Ling, Chen, et autres
Publié: (2026)
L2P: Unlocking Latent Potential for Pixel Generation
par: Chen, Zhennan, et autres
Publié: (2026)
par: Chen, Zhennan, et autres
Publié: (2026)
Taming a Retrieval Framework to Read Images in Humanlike Manner for Augmenting Generation of MLLMs
par: Xi, Suyang, et autres
Publié: (2025)
par: Xi, Suyang, et autres
Publié: (2025)
Lifting the Veil on Visual Information Flow in MLLMs: Unlocking Pathways to Faster Inference
par: Yin, Hao, et autres
Publié: (2025)
par: Yin, Hao, et autres
Publié: (2025)
V-Reflection: Transforming MLLMs from Passive Observers to Active Interrogators
par: Zhou, Jiazhou, et autres
Publié: (2026)
par: Zhou, Jiazhou, et autres
Publié: (2026)
Discrete Diffusion Models with MLLMs for Unified Medical Multimodal Generation
par: Mao, Jiawei, et autres
Publié: (2025)
par: Mao, Jiawei, et autres
Publié: (2025)
Unlocking the Forgery Detection Potential of Vanilla MLLMs: A Novel Training-Free Pipeline
par: Zuo, Rui, et autres
Publié: (2025)
par: Zuo, Rui, et autres
Publié: (2025)
Vision-Language Introspection: Mitigating Overconfident Hallucinations in MLLMs via Interpretable Bi-Causal Steering
par: Liu, Shuliang, et autres
Publié: (2026)
par: Liu, Shuliang, et autres
Publié: (2026)
RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation
par: Chang, Yue, et autres
Publié: (2026)
par: Chang, Yue, et autres
Publié: (2026)
RSAgent: Learning to Reason and Act for Text-Guided Segmentation via Multi-Turn Tool Invocations
par: He, Xingqi, et autres
Publié: (2025)
par: He, Xingqi, et autres
Publié: (2025)
Image Forgery Localization via Guided Noise and Multi-Scale Feature Aggregation
par: Niu, Yakun, et autres
Publié: (2024)
par: Niu, Yakun, et autres
Publié: (2024)
Unlocking the Potential of MLLMs in Referring Expression Segmentation via a Light-weight Mask Decoder
par: Wang, Jingchao, et autres
Publié: (2025)
par: Wang, Jingchao, et autres
Publié: (2025)
MELLA: Bridging Linguistic Capability and Cultural Groundedness for Low-Resource Language MLLMs
par: Gao, Yufei, et autres
Publié: (2025)
par: Gao, Yufei, et autres
Publié: (2025)
TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability
par: Chen, Shimin, et autres
Publié: (2024)
par: Chen, Shimin, et autres
Publié: (2024)
Multimodal Continual Learning with MLLMs from Multi-scenario Perspectives
par: Jiang, Kai, et autres
Publié: (2025)
par: Jiang, Kai, et autres
Publié: (2025)
PriorCLIP: Visual Prior Guided Vision-Language Model for Remote Sensing Image-Text Retrieval
par: Pan, Jiancheng, et autres
Publié: (2024)
par: Pan, Jiancheng, et autres
Publié: (2024)
RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition
par: Liu, Ziyu, et autres
Publié: (2024)
par: Liu, Ziyu, et autres
Publié: (2024)
Retrieval-based Disentangled Representation Learning with Natural Language Supervision
par: Zhou, Jiawei, et autres
Publié: (2022)
par: Zhou, Jiawei, et autres
Publié: (2022)
MedGen: Unlocking Medical Video Generation by Scaling Granularly-annotated Medical Videos
par: Wang, Rongsheng, et autres
Publié: (2025)
par: Wang, Rongsheng, et autres
Publié: (2025)
Locatability-Guided Adaptive Reasoning for Image Geo-Localization with Vision-Language Models
par: Yu, Bo, et autres
Publié: (2026)
par: Yu, Bo, et autres
Publié: (2026)
MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs
par: Yuan, Jiakang, et autres
Publié: (2025)
par: Yuan, Jiakang, et autres
Publié: (2025)
Med-Scout: Curing MLLMs' Geometric Blindness in Medical Perception via Geometry-Aware RL Post-Training
par: Liu, Anglin, et autres
Publié: (2026)
par: Liu, Anglin, et autres
Publié: (2026)
Beyond Generation: Unlocking Universal Editing via Self-Supervised Fine-Tuning
par: Chen, Harold Haodong, et autres
Publié: (2024)
par: Chen, Harold Haodong, et autres
Publié: (2024)
Find Them All: Unveiling MLLMs for Versatile Person Re-identification
par: Li, Jinhao, et autres
Publié: (2025)
par: Li, Jinhao, et autres
Publié: (2025)
Swarm Intelligence in Geo-Localization: A Multi-Agent Large Vision-Language Model Collaborative Framework
par: Han, Xiao, et autres
Publié: (2024)
par: Han, Xiao, et autres
Publié: (2024)
ST-SimDiff: Balancing Spatiotemporal Similarity and Difference for Efficient Video Understanding with MLLMs
par: Luo, Bingjun, et autres
Publié: (2026)
par: Luo, Bingjun, et autres
Publié: (2026)
From Training-Free to Adaptive: Empirical Insights into MLLMs' Understanding of Detection Information
par: Jiao, Qirui, et autres
Publié: (2024)
par: Jiao, Qirui, et autres
Publié: (2024)
Dense Connector for MLLMs
par: Yao, Huanjin, et autres
Publié: (2024)
par: Yao, Huanjin, et autres
Publié: (2024)
Balanced Token Pruning: Accelerating Vision Language Models Beyond Local Optimization
par: Li, Kaiyuan, et autres
Publié: (2025)
par: Li, Kaiyuan, et autres
Publié: (2025)
Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning
par: Guo, Zirun, et autres
Publié: (2025)
par: Guo, Zirun, et autres
Publié: (2025)
Geometric Knowledge-Guided Localized Global Distribution Alignment for Federated Learning
par: Ma, Yanbiao, et autres
Publié: (2025)
par: Ma, Yanbiao, et autres
Publié: (2025)
Documents similaires
-
Cross-View Meets Diffusion: Aerial Image Synthesis with Geometry and Text Guidance
par: Arrabi, Ahmad, et autres
Publié: (2024) -
GeoFlow: Real-Time Fine-Grained Cross-View Geolocalization via Iterative Flow Prediction
par: Lehyeh, Ayesh Abu, et autres
Publié: (2026) -
GeoDTR+: Toward generic cross-view geolocalization via geometric disentanglement
par: Zhang, Xiaohan, et autres
Publié: (2023) -
Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control
par: Jung, Jay, et autres
Publié: (2026) -
Geo$^\textbf{2}$: Geometry-Guided Cross-view Geo-Localization and Image Synthesis
par: Zhang, Yancheng, et autres
Publié: (2026)