Enregistré dans:
| Auteurs principaux: | Li, Wenjun, Wang, Shudong, Zhao, Dong, Xu, Shenghui, Pan, Zhaoming, Zhang, Zhimin |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2407.12798 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Controllable Talking Face Generation by Implicit Facial Keypoints Editing
par: Zhao, Dong, et autres
Publié: (2024)
par: Zhao, Dong, et autres
Publié: (2024)
Heterogeneous Graph-based Framework with Disentangled Representations Learning for Multi-target Cross Domain Recommendation
par: Liu, Xiaopeng, et autres
Publié: (2024)
par: Liu, Xiaopeng, et autres
Publié: (2024)
Perceive, Verify and Understand Long Video: Multi-Granular Perception and Active Verification via Interactive Agents
par: Li, Jiahua, et autres
Publié: (2025)
par: Li, Jiahua, et autres
Publié: (2025)
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
par: Ma, Zehong, et autres
Publié: (2025)
par: Ma, Zehong, et autres
Publié: (2025)
Composed Multi-modal Retrieval: A Survey of Approaches and Applications
par: Zhang, Kun, et autres
Publié: (2025)
par: Zhang, Kun, et autres
Publié: (2025)
MambaDSF: Multi-Scale SSM with Dilated Feature Fusion for Sonar Small Target Detection
par: Lin, Hui, et autres
Publié: (2026)
par: Lin, Hui, et autres
Publié: (2026)
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
par: Wang, Yuxuan, et autres
Publié: (2025)
par: Wang, Yuxuan, et autres
Publié: (2025)
GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection
par: Dai, Guangyu, et autres
Publié: (2025)
par: Dai, Guangyu, et autres
Publié: (2025)
Large Multi-modal Models Can Interpret Features in Large Multi-modal Models
par: Zhang, Kaichen, et autres
Publié: (2024)
par: Zhang, Kaichen, et autres
Publié: (2024)
Multi-Granularity Video Object Segmentation
par: Lim, Sangbeom, et autres
Publié: (2024)
par: Lim, Sangbeom, et autres
Publié: (2024)
Multi-Scale Temporal Difference Transformer for Video-Text Retrieval
par: Wang, Ni, et autres
Publié: (2024)
par: Wang, Ni, et autres
Publié: (2024)
Text-Video Retrieval via Variational Multi-Modal Hypergraph Networks
par: Li, Qian, et autres
Publié: (2024)
par: Li, Qian, et autres
Publié: (2024)
Multi-modal Fusion and Query Refinement Network for Video Moment Retrieval and Highlight Detection
par: Xu, Yifang, et autres
Publié: (2025)
par: Xu, Yifang, et autres
Publié: (2025)
A Multi-Granularity Retrieval Framework for Visually-Rich Documents
par: Xu, Mingjun, et autres
Publié: (2025)
par: Xu, Mingjun, et autres
Publié: (2025)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
par: Zhao, Zixu, et autres
Publié: (2025)
par: Zhao, Zixu, et autres
Publié: (2025)
GEXIA: Granularity Expansion and Iterative Approximation for Scalable Multi-grained Video-language Learning
par: Wang, Yicheng, et autres
Publié: (2024)
par: Wang, Yicheng, et autres
Publié: (2024)
Token Entropy Regularization for Multi-modal Antenna Affiliation Identification
par: Chen, Dong, et autres
Publié: (2026)
par: Chen, Dong, et autres
Publié: (2026)
MVBench: A Comprehensive Multi-modal Video Understanding Benchmark
par: Li, Kunchang, et autres
Publié: (2023)
par: Li, Kunchang, et autres
Publié: (2023)
MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding
par: Li, Zizhong, et autres
Publié: (2026)
par: Li, Zizhong, et autres
Publié: (2026)
Subject-Aware Multi-Granularity Alignment for Zero-Shot EEG-to-Image Retrieval
par: Jiang, Lin, et autres
Publié: (2026)
par: Jiang, Lin, et autres
Publié: (2026)
VideoFusion: A Spatio-Temporal Collaborative Network for Multi-modal Video Fusion
par: Tang, Linfeng, et autres
Publié: (2025)
par: Tang, Linfeng, et autres
Publié: (2025)
Thinking in Granularity: Dynamic Quantization for Image Super-Resolution by Intriguing Multi-Granularity Clues
par: Wang, Mingshen, et autres
Publié: (2024)
par: Wang, Mingshen, et autres
Publié: (2024)
DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation
par: Huang, Minbin, et autres
Publié: (2024)
par: Huang, Minbin, et autres
Publié: (2024)
Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing
par: Chen, Xi, et autres
Publié: (2026)
par: Chen, Xi, et autres
Publié: (2026)
Multi-event Video-Text Retrieval
par: Zhang, Gengyuan, et autres
Publié: (2023)
par: Zhang, Gengyuan, et autres
Publié: (2023)
FSMR: A Feature Swapping Multi-modal Reasoning Approach with Joint Textual and Visual Clues
par: Li, Shuang, et autres
Publié: (2024)
par: Li, Shuang, et autres
Publié: (2024)
RoboSVG: A Unified Framework for Interactive SVG Generation with Multi-modal Guidance
par: Wang, Jiuniu, et autres
Publié: (2025)
par: Wang, Jiuniu, et autres
Publié: (2025)
MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer
par: Tian, Changyao, et autres
Publié: (2024)
par: Tian, Changyao, et autres
Publié: (2024)
TiFRe: Text-guided Video Frame Reduction for Efficient Video Multi-modal Large Language Models
par: Zheng, Xiangtian, et autres
Publié: (2026)
par: Zheng, Xiangtian, et autres
Publié: (2026)
Multi-Granularity Representation Learning for Sketch-based Dynamic Face Image Retrieval
par: Wang, Liang, et autres
Publié: (2023)
par: Wang, Liang, et autres
Publié: (2023)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models
par: Cao, Yuhang, et autres
Publié: (2024)
par: Cao, Yuhang, et autres
Publié: (2024)
CLIP Multi-modal Hashing for Multimedia Retrieval
par: Zhu, Jian, et autres
Publié: (2024)
par: Zhu, Jian, et autres
Publié: (2024)
Multi-Granularity Feature Calibration via VFM for Domain Generalized Semantic Segmentation
par: Li, Xinhui, et autres
Publié: (2025)
par: Li, Xinhui, et autres
Publié: (2025)
MV-Adapter: Multimodal Video Transfer Learning for Video Text Retrieval
par: Jin, Xiaojie, et autres
Publié: (2023)
par: Jin, Xiaojie, et autres
Publié: (2023)
$β$-CLIP: Text-Conditioned Contrastive Learning for Multi-Granular Vision-Language Alignment
par: Zohra, Fatimah, et autres
Publié: (2025)
par: Zohra, Fatimah, et autres
Publié: (2025)
GroundingGPT:Language Enhanced Multi-modal Grounding Model
par: Li, Zhaowei, et autres
Publié: (2024)
par: Li, Zhaowei, et autres
Publié: (2024)
Zero-Shot Chinese Character Recognition with Hierarchical Multi-Granularity Image-Text Aligning
par: Zhu, Yinglian, et autres
Publié: (2025)
par: Zhu, Yinglian, et autres
Publié: (2025)
Seeing Beyond Views: Multi-View Driving Scene Video Generation with Holistic Attention
par: Lu, Hannan, et autres
Publié: (2024)
par: Lu, Hannan, et autres
Publié: (2024)
Interactive Multi-Turn Retrieval for Health Videos
par: Wu, Chengzheng, et autres
Publié: (2026)
par: Wu, Chengzheng, et autres
Publié: (2026)
Documents similaires
-
Controllable Talking Face Generation by Implicit Facial Keypoints Editing
par: Zhao, Dong, et autres
Publié: (2024) -
Heterogeneous Graph-based Framework with Disentangled Representations Learning for Multi-target Cross Domain Recommendation
par: Liu, Xiaopeng, et autres
Publié: (2024) -
Perceive, Verify and Understand Long Video: Multi-Granular Perception and Active Verification via Interactive Agents
par: Li, Jiahua, et autres
Publié: (2025) -
Multi-modal Reference Learning for Fine-grained Text-to-Image Retrieval
par: Ma, Zehong, et autres
Publié: (2025) -
Composed Multi-modal Retrieval: A Survey of Approaches and Applications
par: Zhang, Kun, et autres
Publié: (2025)