Retrieval-based Disentangled Representation Learning with Natural Language Supervision
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhou, Jiawei, Li, Xiaoguang, Shang, Lifeng, Jiang, Xin, Liu, Qun, Chen, Lei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2022
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
C${^2}$RL: Content and Context Representation Learning for Gloss-free Sign Language Translation and Retrieval
por: Chen, Zhigang, et al.
Publicado: (2024)
por: Chen, Zhigang, et al.
Publicado: (2024)
SHuBERT: Self-Supervised Sign Language Representation Learning via Multi-Stream Cluster Prediction
por: Gueuwou, Shester, et al.
Publicado: (2024)
por: Gueuwou, Shester, et al.
Publicado: (2024)
Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding
por: Ma, Ruiqi, et al.
Publicado: (2025)
por: Ma, Ruiqi, et al.
Publicado: (2025)
Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval
por: Cai, Rui, et al.
Publicado: (2024)
por: Cai, Rui, et al.
Publicado: (2024)
MobileRAG: Enhancing Mobile Agent with Retrieval-Augmented Generation
por: Loo, Gowen, et al.
Publicado: (2025)
por: Loo, Gowen, et al.
Publicado: (2025)
Dream-VL & Dream-VLA: Open Vision-Language and Vision-Language-Action Models with Diffusion Language Model Backbone
por: Ye, Jiacheng, et al.
Publicado: (2025)
por: Ye, Jiacheng, et al.
Publicado: (2025)
Toward Robust Incomplete Multimodal Sentiment Analysis via Hierarchical Representation Learning
por: Li, Mingcheng, et al.
Publicado: (2024)
por: Li, Mingcheng, et al.
Publicado: (2024)
Knowledge Acquisition Disentanglement for Knowledge-based Visual Question Answering with Large Language Models
por: An, Wenbin, et al.
Publicado: (2024)
por: An, Wenbin, et al.
Publicado: (2024)
Cost-effective Instruction Learning for Pathology Vision and Language Analysis
por: Chen, Kaitao, et al.
Publicado: (2024)
por: Chen, Kaitao, et al.
Publicado: (2024)
Dynamic Token Reweighting for Robust Vision-Language Models
por: Jiang, Tanqiu, et al.
Publicado: (2025)
por: Jiang, Tanqiu, et al.
Publicado: (2025)
From Pixels to Tokens: Revisiting Object Hallucinations in Large Vision-Language Models
por: Shang, Yuying, et al.
Publicado: (2024)
por: Shang, Yuying, et al.
Publicado: (2024)
DATA: Multi-Disentanglement based Contrastive Learning for Open-World Semi-Supervised Deepfake Attribution
por: Liu, Ming-Hui, et al.
Publicado: (2025)
por: Liu, Ming-Hui, et al.
Publicado: (2025)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
por: Liu, Jianyu, et al.
Publicado: (2025)
por: Liu, Jianyu, et al.
Publicado: (2025)
NaturalBench: Evaluating Vision-Language Models on Natural Adversarial Samples
por: Li, Baiqi, et al.
Publicado: (2024)
por: Li, Baiqi, et al.
Publicado: (2024)
Visually Guided Generative Text-Layout Pre-training for Document Intelligence
por: Mao, Zhiming, et al.
Publicado: (2024)
por: Mao, Zhiming, et al.
Publicado: (2024)
Weakly-Supervised 3D Visual Grounding based on Visual Language Alignment
por: Xu, Xiaoxu, et al.
Publicado: (2023)
por: Xu, Xiaoxu, et al.
Publicado: (2023)
Draw2Think: Harnessing Geometry Reasoning through Constraint Engine Interaction
por: Hu, Juncheng, et al.
Publicado: (2026)
por: Hu, Juncheng, et al.
Publicado: (2026)
MMViR: A Multi-Modal and Multi-Granularity Representation for Long-range Video Understanding
por: Li, Zizhong, et al.
Publicado: (2026)
por: Li, Zizhong, et al.
Publicado: (2026)
Visual Representations inside the Language Model
por: Liu, Benlin, et al.
Publicado: (2025)
por: Liu, Benlin, et al.
Publicado: (2025)
Generative Sign-description Prompts with Multi-positive Contrastive Learning for Sign Language Recognition
por: Liang, Siyu, et al.
Publicado: (2025)
por: Liang, Siyu, et al.
Publicado: (2025)
Using Multimodal Deep Neural Networks to Disentangle Language from Visual Aesthetics
por: Conwell, Colin, et al.
Publicado: (2024)
por: Conwell, Colin, et al.
Publicado: (2024)
Grounding Language with Vision: A Conditional Mutual Information Calibrated Decoding Strategy for Reducing Hallucinations in LVLMs
por: Fang, Hao, et al.
Publicado: (2025)
por: Fang, Hao, et al.
Publicado: (2025)
Cross-Modal Retrieval for Motion and Text via DropTriple Loss
por: Yan, Sheng, et al.
Publicado: (2023)
por: Yan, Sheng, et al.
Publicado: (2023)
Unlocking Exocentric Video-Language Data for Egocentric Video Representation Learning
por: Dou, Zi-Yi, et al.
Publicado: (2024)
por: Dou, Zi-Yi, et al.
Publicado: (2024)
Pixel Sentence Representation Learning
por: Xiao, Chenghao, et al.
Publicado: (2024)
por: Xiao, Chenghao, et al.
Publicado: (2024)
Learning Disentangled Representations for Generalized Multi-view Clustering
por: Zou, Xin, et al.
Publicado: (2026)
por: Zou, Xin, et al.
Publicado: (2026)
MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval
por: Zhou, Junjie, et al.
Publicado: (2024)
por: Zhou, Junjie, et al.
Publicado: (2024)
Towards Natural Language-Based Document Image Retrieval: New Dataset and Benchmark
por: Guo, Hao, et al.
Publicado: (2025)
por: Guo, Hao, et al.
Publicado: (2025)
Graph-based Unsupervised Disentangled Representation Learning via Multimodal Large Language Models
por: Xie, Baao, et al.
Publicado: (2024)
por: Xie, Baao, et al.
Publicado: (2024)
MAMA: Meta-optimized Angular Margin Contrastive Framework for Video-Language Representation Learning
por: Nguyen, Thong, et al.
Publicado: (2024)
por: Nguyen, Thong, et al.
Publicado: (2024)
Frame-Voyager: Learning to Query Frames for Video Large Language Models
por: Yu, Sicheng, et al.
Publicado: (2024)
por: Yu, Sicheng, et al.
Publicado: (2024)
DEADiff: An Efficient Stylization Diffusion Model with Disentangled Representations
por: Qi, Tianhao, et al.
Publicado: (2024)
por: Qi, Tianhao, et al.
Publicado: (2024)
Natural Language Inference Improves Compositionality in Vision-Language Models
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
por: Cascante-Bonilla, Paola, et al.
Publicado: (2024)
Disentangled Textual Priors for Diffusion-based Image Super-Resolution
por: Jiang, Lei, et al.
Publicado: (2026)
por: Jiang, Lei, et al.
Publicado: (2026)
Exploring the Design Space of Visual Context Representation in Video MLLMs
por: Du, Yifan, et al.
Publicado: (2024)
por: Du, Yifan, et al.
Publicado: (2024)
Improving Hateful Meme Detection through Retrieval-Guided Contrastive Learning
por: Mei, Jingbiao, et al.
Publicado: (2023)
por: Mei, Jingbiao, et al.
Publicado: (2023)
A Spatio-Temporal Representation Learning as an Alternative to Traditional Glosses in Sign Language Translation and Production
por: Hwang, Eui Jun, et al.
Publicado: (2024)
por: Hwang, Eui Jun, et al.
Publicado: (2024)
A Tale of Two Languages: Large-Vocabulary Continuous Sign Language Recognition from Spoken Language Supervision
por: Raude, Charles, et al.
Publicado: (2024)
por: Raude, Charles, et al.
Publicado: (2024)
LocoMotion: Learning Motion-Focused Video-Language Representations
por: Doughty, Hazel, et al.
Publicado: (2024)
por: Doughty, Hazel, et al.
Publicado: (2024)
Naturally Supervised 3D Visual Grounding with Language-Regularized Concept Learners
por: Feng, Chun, et al.
Publicado: (2024)
por: Feng, Chun, et al.
Publicado: (2024)
Ejemplares similares
-
C${^2}$RL: Content and Context Representation Learning for Gloss-free Sign Language Translation and Retrieval
por: Chen, Zhigang, et al.
Publicado: (2024) -
SHuBERT: Self-Supervised Sign Language Representation Learning via Multi-Stream Cluster Prediction
por: Gueuwou, Shester, et al.
Publicado: (2024) -
Watch Closely: Mitigating Object Hallucinations in Large Vision-Language Models with Disentangled Decoding
por: Ma, Ruiqi, et al.
Publicado: (2025) -
Dynamic Adapter with Semantics Disentangling for Cross-lingual Cross-modal Retrieval
por: Cai, Rui, et al.
Publicado: (2024) -
MobileRAG: Enhancing Mobile Agent with Retrieval-Augmented Generation
por: Loo, Gowen, et al.
Publicado: (2025)