Salvato in:
| Autori principali: | Chao, Lianying, Zhang, Kai, Cai, Haoran, Wu, Sijie, Li, Xubin, Chen, Xin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2601.09298 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning
di: Chao, Lianying, et al.
Pubblicazione: (2026)
di: Chao, Lianying, et al.
Pubblicazione: (2026)
Pseudo Multi-Source Domain Generalization: Bridging the Gap Between Single and Multi-Source Domain Generalization
di: Enomoto, Shohei
Pubblicazione: (2025)
di: Enomoto, Shohei
Pubblicazione: (2025)
Panoptic Captioning: An Equivalence Bridge for Image and Text
di: Lin, Kun-Yu, et al.
Pubblicazione: (2025)
di: Lin, Kun-Yu, et al.
Pubblicazione: (2025)
Can Diffusion Models Bridge the Domain Gap in Cardiac MR Imaging?
di: Wong, Xin Ci, et al.
Pubblicazione: (2025)
di: Wong, Xin Ci, et al.
Pubblicazione: (2025)
Bridge the Gap between SNN and ANN for Image Restoration
di: Su, Xin, et al.
Pubblicazione: (2025)
di: Su, Xin, et al.
Pubblicazione: (2025)
CrossFlowDG: Bridging the Modality Gap with Cross-modal Flow Matching for Domain Generalization
di: Kritikos, Antonios, et al.
Pubblicazione: (2026)
di: Kritikos, Antonios, et al.
Pubblicazione: (2026)
Text-Only Training for Image Captioning with Retrieval Augmentation and Modality Gap Correction
di: Fonseca, Rui, et al.
Pubblicazione: (2025)
di: Fonseca, Rui, et al.
Pubblicazione: (2025)
PRFusion: Toward Effective and Robust Multi-Modal Place Recognition with Image and Point Cloud Fusion
di: Wang, Sijie, et al.
Pubblicazione: (2024)
di: Wang, Sijie, et al.
Pubblicazione: (2024)
Bridging the Inter-Domain Gap through Low-Level Features for Cross-Modal Medical Image Segmentation
di: Lyu, Pengfei, et al.
Pubblicazione: (2025)
di: Lyu, Pengfei, et al.
Pubblicazione: (2025)
VIVECaption: A Split Approach to Caption Quality Improvement
di: Ananth, Varun, et al.
Pubblicazione: (2026)
di: Ananth, Varun, et al.
Pubblicazione: (2026)
DiffSensei: Bridging Multi-Modal LLMs and Diffusion Models for Customized Manga Generation
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
di: Wu, Jianzong, et al.
Pubblicazione: (2024)
Bridging Modality Gap for Visual Grounding with Effecitve Cross-modal Distillation
di: Wang, Jiaxi, et al.
Pubblicazione: (2023)
di: Wang, Jiaxi, et al.
Pubblicazione: (2023)
BRIDGE: Bridging Gaps in Image Captioning Evaluation with Stronger Visual Cues
di: Sarto, Sara, et al.
Pubblicazione: (2024)
di: Sarto, Sara, et al.
Pubblicazione: (2024)
Bridge the Modality and Capability Gaps in Vision-Language Model Selection
di: Yi, Chao, et al.
Pubblicazione: (2024)
di: Yi, Chao, et al.
Pubblicazione: (2024)
CDAD-Net: Bridging Domain Gaps in Generalized Category Discovery
di: Rongali, Sai Bhargav, et al.
Pubblicazione: (2024)
di: Rongali, Sai Bhargav, et al.
Pubblicazione: (2024)
MultiModal Fine-tuning with Synthetic Captions
di: Enomoto, Shohei, et al.
Pubblicazione: (2026)
di: Enomoto, Shohei, et al.
Pubblicazione: (2026)
Rewrite Caption Semantics: Bridging Semantic Gaps for Language-Supervised Semantic Segmentation
di: Xing, Yun, et al.
Pubblicazione: (2023)
di: Xing, Yun, et al.
Pubblicazione: (2023)
Uncertainty-Aware ControlNet: Bridging Domain Gaps with Synthetic Image Generation
di: Niemeijer, Joshua, et al.
Pubblicazione: (2025)
di: Niemeijer, Joshua, et al.
Pubblicazione: (2025)
Image Intrinsic Scale Assessment: Bridging the Gap Between Quality and Resolution
di: Hosu, Vlad, et al.
Pubblicazione: (2025)
di: Hosu, Vlad, et al.
Pubblicazione: (2025)
SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs
di: Lou, Haoran, et al.
Pubblicazione: (2026)
di: Lou, Haoran, et al.
Pubblicazione: (2026)
Bridging the Gap: Multi-Level Cross-Modality Joint Alignment for Visible-Infrared Person Re-Identification
di: Liang, Tengfei, et al.
Pubblicazione: (2023)
di: Liang, Tengfei, et al.
Pubblicazione: (2023)
CapS-Adapter: Caption-based MultiModal Adapter in Zero-Shot Classification
di: Wang, Qijie, et al.
Pubblicazione: (2024)
di: Wang, Qijie, et al.
Pubblicazione: (2024)
Multi-Reward as Condition for Instruction-based Image Editing
di: Gu, Xin, et al.
Pubblicazione: (2024)
di: Gu, Xin, et al.
Pubblicazione: (2024)
IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning
di: Qiu, Tianheng, et al.
Pubblicazione: (2025)
di: Qiu, Tianheng, et al.
Pubblicazione: (2025)
Multi-clue Consistency Learning to Bridge Gaps Between General and Oriented Object in Semi-supervised Detection
di: Wang, Chenxu, et al.
Pubblicazione: (2024)
di: Wang, Chenxu, et al.
Pubblicazione: (2024)
SimMLM: A Simple Framework for Multi-modal Learning with Missing Modality
di: Li, Sijie, et al.
Pubblicazione: (2025)
di: Li, Sijie, et al.
Pubblicazione: (2025)
Exploring Diverse In-Context Configurations for Image Captioning
di: Yang, Xu, et al.
Pubblicazione: (2023)
di: Yang, Xu, et al.
Pubblicazione: (2023)
Bridging the Gap Between Ideal and Real-world Evaluation: Benchmarking AI-Generated Image Detection in Challenging Scenarios
di: Li, Chunxiao, et al.
Pubblicazione: (2025)
di: Li, Chunxiao, et al.
Pubblicazione: (2025)
TPCap: Unlocking Zero-Shot Image Captioning with Trigger-Augmented and Multi-Modal Purification Modules
di: Zhang, Ruoyu, et al.
Pubblicazione: (2025)
di: Zhang, Ruoyu, et al.
Pubblicazione: (2025)
Multimodal Unsupervised Domain Generalization by Retrieving Across the Modality Gap
di: Liao, Christopher, et al.
Pubblicazione: (2024)
di: Liao, Christopher, et al.
Pubblicazione: (2024)
Improving Multi-Subject Consistency in Open-Domain Image Generation with Isolation and Reposition Attention
di: He, Huiguo, et al.
Pubblicazione: (2024)
di: He, Huiguo, et al.
Pubblicazione: (2024)
SceneBooth: Diffusion-based Framework for Subject-preserved Text-to-Image Generation
di: Chai, Shang, et al.
Pubblicazione: (2025)
di: Chai, Shang, et al.
Pubblicazione: (2025)
SuperCap: Multi-resolution Superpixel-based Image Captioning
di: Senior, Henry, et al.
Pubblicazione: (2025)
di: Senior, Henry, et al.
Pubblicazione: (2025)
Diffusion Features to Bridge Domain Gap for Semantic Segmentation
di: Ji, Yuxiang, et al.
Pubblicazione: (2024)
di: Ji, Yuxiang, et al.
Pubblicazione: (2024)
Bridging the Gap Between Saliency Prediction and Image Quality Assessment
di: Alexey, Kirillov, et al.
Pubblicazione: (2024)
di: Alexey, Kirillov, et al.
Pubblicazione: (2024)
Multi-LLM Collaborative Caption Generation in Scientific Documents
di: Kim, Jaeyoung, et al.
Pubblicazione: (2025)
di: Kim, Jaeyoung, et al.
Pubblicazione: (2025)
Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition
di: Do, Jeonghyeok, et al.
Pubblicazione: (2024)
di: Do, Jeonghyeok, et al.
Pubblicazione: (2024)
Bridging the Domain Gap: A Simple Domain Matching Method for Reference-based Image Super-Resolution in Remote Sensing
di: Min, Jeongho, et al.
Pubblicazione: (2024)
di: Min, Jeongho, et al.
Pubblicazione: (2024)
Bridging the Domain Gap for Flight-Ready Spaceborne Vision
di: Park, Tae Ha, et al.
Pubblicazione: (2024)
di: Park, Tae Ha, et al.
Pubblicazione: (2024)
Bridge the Gap Between Visual and Linguistic Comprehension for Generalized Zero-shot Semantic Segmentation
di: Guo, Xiaoqing, et al.
Pubblicazione: (2025)
di: Guo, Xiaoqing, et al.
Pubblicazione: (2025)
Documenti analoghi
-
LFS: Learnable Frame Selector for Event-Aware and Temporally Diverse Video Captioning
di: Chao, Lianying, et al.
Pubblicazione: (2026) -
Pseudo Multi-Source Domain Generalization: Bridging the Gap Between Single and Multi-Source Domain Generalization
di: Enomoto, Shohei
Pubblicazione: (2025) -
Panoptic Captioning: An Equivalence Bridge for Image and Text
di: Lin, Kun-Yu, et al.
Pubblicazione: (2025) -
Can Diffusion Models Bridge the Domain Gap in Cardiac MR Imaging?
di: Wong, Xin Ci, et al.
Pubblicazione: (2025) -
Bridge the Gap between SNN and ANN for Image Restoration
di: Su, Xin, et al.
Pubblicazione: (2025)