StructAlign: Structured Cross-Modal Alignment for Continual Text-to-Video Retrieval
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Shaokun, Guan, Weili, Han, Jizhou, Wu, Jianlong, Hu, Yupeng, Nie, Liqiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2026
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking
por: Li, Zixu, et al.
Publicado: (2026)
por: Li, Zixu, et al.
Publicado: (2026)
The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation
por: He, Xusheng, et al.
Publicado: (2026)
por: He, Xusheng, et al.
Publicado: (2026)
Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge
por: Zhang, Jinrong, et al.
Publicado: (2026)
por: Zhang, Jinrong, et al.
Publicado: (2026)
Self-Enhanced Image Clustering with Cross-Modal Semantic Consistency
por: Li, Zihan, et al.
Publicado: (2025)
por: Li, Zihan, et al.
Publicado: (2025)
OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026
por: Li, Zixu, et al.
Publicado: (2026)
por: Li, Zixu, et al.
Publicado: (2026)
TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge
por: Li, Zixu, et al.
Publicado: (2026)
por: Li, Zixu, et al.
Publicado: (2026)
UniCVR: From Alignment to Reranking for Unified Zero-Shot Composed Visual Retrieval
por: Wen, Haokun, et al.
Publicado: (2026)
por: Wen, Haokun, et al.
Publicado: (2026)
PUMA: Layer-Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning
por: Lyu, Yibo, et al.
Publicado: (2025)
por: Lyu, Yibo, et al.
Publicado: (2025)
Cross-Modal and Uni-Modal Soft-Label Alignment for Image-Text Retrieval
por: Huang, Hailang, et al.
Publicado: (2024)
por: Huang, Hailang, et al.
Publicado: (2024)
TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval
por: Li, Zixu, et al.
Publicado: (2026)
por: Li, Zixu, et al.
Publicado: (2026)
EgoAdapt: A Multi-Scene Egocentric Adaptation Method for CVPR 2026 HD-EPIC VQA Challenge
por: Chen, Zhiwei, et al.
Publicado: (2026)
por: Chen, Zhiwei, et al.
Publicado: (2026)
EgoAction: Egocentric Action Composition with Reliability-Aware Temporal Fusion for the EPIC-KITCHENS Action Detection Challenge at CVPR 2026
por: Fu, Zhiheng, et al.
Publicado: (2026)
por: Fu, Zhiheng, et al.
Publicado: (2026)
PersonalAlign: Hierarchical Implicit Intent Alignment for Personalized GUI Agent with Long-Term User-Centric Records
por: Lyu, Yibo, et al.
Publicado: (2026)
por: Lyu, Yibo, et al.
Publicado: (2026)
HUD: Hierarchical Uncertainty-Aware Disambiguation Network for Composed Video Retrieval
por: Chen, Zhiwei, et al.
Publicado: (2025)
por: Chen, Zhiwei, et al.
Publicado: (2025)
TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval
por: Zhao, Zixu, et al.
Publicado: (2025)
por: Zhao, Zixu, et al.
Publicado: (2025)
Object-Shot Enhanced Grounding Network for Egocentric Video
por: Feng, Yisen, et al.
Publicado: (2025)
por: Feng, Yisen, et al.
Publicado: (2025)
GOAL: Geometrically Optimal Alignment for Continual Generalized Category Discovery
por: Han, Jizhou, et al.
Publicado: (2026)
por: Han, Jizhou, et al.
Publicado: (2026)
Continuous Knowledge-Preserving Decomposition with Adaptive Layer Selection for Few-Shot Class-Incremental Learning
por: Li, Xiaojie, et al.
Publicado: (2025)
por: Li, Xiaojie, et al.
Publicado: (2025)
Spatial Understanding from Videos: Structured Prompts Meet Simulation Data
por: Zhang, Haoyu, et al.
Publicado: (2025)
por: Zhang, Haoyu, et al.
Publicado: (2025)
Handling Imbalanced Pseudolabels for Vision-Language Models with Concept Alignment and Confusion-Aware Calibrated Margin
por: Wang, Yuchen, et al.
Publicado: (2025)
por: Wang, Yuchen, et al.
Publicado: (2025)
OFFSET: Segmentation-based Focus Shift Revision for Composed Image Retrieval
por: Chen, Zhiwei, et al.
Publicado: (2025)
por: Chen, Zhiwei, et al.
Publicado: (2025)
MoME: Mixture of Multimodal Experts for Generalist Multimodal Large Language Models
por: Shen, Leyang, et al.
Publicado: (2024)
por: Shen, Leyang, et al.
Publicado: (2024)
Curriculum Coarse-to-Fine Selection for High-IPC Dataset Distillation
por: Chen, Yanda, et al.
Publicado: (2025)
por: Chen, Yanda, et al.
Publicado: (2025)
Uncovering Hidden Connections: Iterative Search and Reasoning for Video-grounded Dialog
por: Zhang, Haoyu, et al.
Publicado: (2023)
por: Zhang, Haoyu, et al.
Publicado: (2023)
ConeSep: Cone-based Robust Noise-Unlearning Compositional Network for Composed Image Retrieval
por: Li, Zixu, et al.
Publicado: (2026)
por: Li, Zixu, et al.
Publicado: (2026)
ViSAGE @ NTIRE 2026 Challenge on Video Saliency Prediction
por: Wang, Kun, et al.
Publicado: (2026)
por: Wang, Kun, et al.
Publicado: (2026)
Fine-grained Textual Inversion Network for Zero-Shot Composed Image Retrieval
por: Lin, Haoqiang, et al.
Publicado: (2025)
por: Lin, Haoqiang, et al.
Publicado: (2025)
Consistent Supervised-Unsupervised Alignment for Generalized Category Discovery
por: Han, Jizhou, et al.
Publicado: (2025)
por: Han, Jizhou, et al.
Publicado: (2025)
IOTA: Corrective Knowledge-Guided Prompt Learning via Black-White Box Framework
por: Wang, Shaokun, et al.
Publicado: (2026)
por: Wang, Shaokun, et al.
Publicado: (2026)
Multi-Modal Cross-Domain Alignment Network for Video Moment Retrieval
por: Fang, Xiang, et al.
Publicado: (2022)
por: Fang, Xiang, et al.
Publicado: (2022)
FineCIR: Explicit Parsing of Fine-Grained Modification Semantics for Composed Image Retrieval
por: Li, Zixu, et al.
Publicado: (2025)
por: Li, Zixu, et al.
Publicado: (2025)
A Survey on Video Temporal Grounding with Multimodal Large Language Model
por: Wu, Jianlong, et al.
Publicado: (2025)
por: Wu, Jianlong, et al.
Publicado: (2025)
Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding
por: Zhang, Renshan, et al.
Publicado: (2024)
por: Zhang, Renshan, et al.
Publicado: (2024)
ReTaKe: Reducing Temporal and Knowledge Redundancy for Long Video Understanding
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
Leveraging Modality Tags for Enhanced Cross-Modal Video Retrieval
por: Fragomeni, Adriano, et al.
Publicado: (2025)
por: Fragomeni, Adriano, et al.
Publicado: (2025)
Video DataFlywheel: Resolving the Impossible Data Trinity in Video-Language Understanding
por: Wang, Xiao, et al.
Publicado: (2024)
por: Wang, Xiao, et al.
Publicado: (2024)
Decoupled Cross-Modal Alignment Network for Text-RGBT Person Retrieval and A High-Quality Benchmark
por: Deng, Yifei, et al.
Publicado: (2025)
por: Deng, Yifei, et al.
Publicado: (2025)
AdaReTaKe: Adaptive Redundancy Reduction to Perceive Longer for Video-language Understanding
por: Wang, Xiao, et al.
Publicado: (2025)
por: Wang, Xiao, et al.
Publicado: (2025)
DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning
por: Qian, Chengxuan, et al.
Publicado: (2025)
por: Qian, Chengxuan, et al.
Publicado: (2025)
AlignGen: Boosting Personalized Image Generation with Cross-Modality Prior Alignment
por: Lin, Yiheng, et al.
Publicado: (2025)
por: Lin, Yiheng, et al.
Publicado: (2025)
Ejemplares similares
-
R^3: Composed Video Retrieval via Reasoning-Guided Recalling and Re-ranking
por: Li, Zixu, et al.
Publicado: (2026) -
The 1st Winner for 5th PVUW MeViS-Text Challenge: Strong MLLMs Meet SAM3 for Referring Video Object Segmentation
por: He, Xusheng, et al.
Publicado: (2026) -
Advancing Complex Video Object Segmentation via Tracking-Enhanced Prompt: The 1st Winner for 5th PVUW MOSE Challenge
por: Zhang, Jinrong, et al.
Publicado: (2026) -
Self-Enhanced Image Clustering with Cross-Modal Semantic Consistency
por: Li, Zihan, et al.
Publicado: (2025) -
OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026
por: Li, Zixu, et al.
Publicado: (2026)