Saved in:
| Main Authors: | Yan, Hua, Tan, Heng, Ding, Yi, Zhou, Pengfei, Namboodiri, Vinod, Yang, Yu |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | https://arxiv.org/abs/2410.00003 |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
by: Yang, Lei, et al.
Published: (2026)
by: Yang, Lei, et al.
Published: (2026)
Semantic Alignment for Multimodal Large Language Models
by: Wu, Tao, et al.
Published: (2024)
by: Wu, Tao, et al.
Published: (2024)
NaVIP: An Image-Centric Indoor Navigation Solution for Visually Impaired People
by: Yu, Jun, et al.
Published: (2024)
by: Yu, Jun, et al.
Published: (2024)
Trusting Semantic Segmentation Networks
by: Some, Samik, et al.
Published: (2024)
by: Some, Samik, et al.
Published: (2024)
Can Unsupervised Segmentation Reduce Annotation Costs for Video Semantic Segmentation?
by: Some, Samik, et al.
Published: (2026)
by: Some, Samik, et al.
Published: (2026)
Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment
by: Cui, Feng-Qi, et al.
Published: (2025)
by: Cui, Feng-Qi, et al.
Published: (2025)
Zero-Shot Skeleton-Based Action Recognition With Prototype-Guided Feature Alignment
by: Zhou, Kai, et al.
Published: (2025)
by: Zhou, Kai, et al.
Published: (2025)
MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition
by: Zhao, Weichao, et al.
Published: (2024)
by: Zhao, Weichao, et al.
Published: (2024)
Assessment of Multimodal Large Language Models in Alignment with Human Values
by: Shi, Zhelun, et al.
Published: (2024)
by: Shi, Zhelun, et al.
Published: (2024)
Frequency-Enhanced Diffusion Models: Curriculum-Guided Semantic Alignment for Zero-Shot Skeleton Action Recognition
by: Zhou, Yuxi, et al.
Published: (2026)
by: Zhou, Yuxi, et al.
Published: (2026)
Uncertainty and Energy based Loss Guided Semi-Supervised Semantic Segmentation
by: Thakur, Rini Smita, et al.
Published: (2025)
by: Thakur, Rini Smita, et al.
Published: (2025)
Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model
by: Dong, Jihao, et al.
Published: (2024)
by: Dong, Jihao, et al.
Published: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
by: Wu, Yuhang, et al.
Published: (2024)
by: Wu, Yuhang, et al.
Published: (2024)
Self-supervised Representation Learning for Cell Event Recognition through Time Arrow Prediction
by: Chen, Cangxiong, et al.
Published: (2024)
by: Chen, Cangxiong, et al.
Published: (2024)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
by: Liu, Yang, et al.
Published: (2024)
by: Liu, Yang, et al.
Published: (2024)
MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment
by: Das, Anurag, et al.
Published: (2024)
by: Das, Anurag, et al.
Published: (2024)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
by: Kim, Jeonghwan, et al.
Published: (2024)
by: Kim, Jeonghwan, et al.
Published: (2024)
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
by: He, Hulingxiao, et al.
Published: (2026)
by: He, Hulingxiao, et al.
Published: (2026)
SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models
by: Wang, Haobo, et al.
Published: (2026)
by: Wang, Haobo, et al.
Published: (2026)
Multi-Text Guided Few-Shot Semantic Segmentation
by: Jiao, Qiang, et al.
Published: (2025)
by: Jiao, Qiang, et al.
Published: (2025)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
by: Park, Sungjune, et al.
Published: (2025)
by: Park, Sungjune, et al.
Published: (2025)
StyleYourSmile: Cross-Domain Face Retargeting Without Paired Multi-Style Data
by: Dey, Avirup, et al.
Published: (2025)
by: Dey, Avirup, et al.
Published: (2025)
Fusion2Print: Deep Flash-Non-Flash Fusion for Contactless Fingerprint Matching
by: Sahoo, Roja, et al.
Published: (2026)
by: Sahoo, Roja, et al.
Published: (2026)
CLIP Adaptation by Intra-modal Overlap Reduction
by: Kravets, Alexey, et al.
Published: (2024)
by: Kravets, Alexey, et al.
Published: (2024)
TalkLoRA: Low-Rank Adaptation for Speech-Driven Animation
by: Saunders, Jack, et al.
Published: (2024)
by: Saunders, Jack, et al.
Published: (2024)
Zero-Shot Class Unlearning in CLIP with Synthetic Samples
by: Kravets, A., et al.
Published: (2024)
by: Kravets, A., et al.
Published: (2024)
Illumination-Aware Contactless Fingerprint Spoof Detection via Paired Flash-Non-Flash Imaging
by: Sahoo, Roja, et al.
Published: (2026)
by: Sahoo, Roja, et al.
Published: (2026)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
by: Yan, Ziang, et al.
Published: (2024)
by: Yan, Ziang, et al.
Published: (2024)
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
by: Zhang, Xinyao, et al.
Published: (2026)
by: Zhang, Xinyao, et al.
Published: (2026)
Diverse Semantics-Guided Feature Alignment and Decoupling for Visible-Infrared Person Re-Identification
by: Dong, Neng, et al.
Published: (2025)
by: Dong, Neng, et al.
Published: (2025)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
by: Peng, Jingwei, et al.
Published: (2025)
by: Peng, Jingwei, et al.
Published: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
by: Zhan, Yufei, et al.
Published: (2025)
by: Zhan, Yufei, et al.
Published: (2025)
MaskFi: Unsupervised Learning of WiFi and Vision Representations for Multimodal Human Activity Recognition
by: Yang, Jianfei, et al.
Published: (2024)
by: Yang, Jianfei, et al.
Published: (2024)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
by: Cao, Sihan, et al.
Published: (2026)
by: Cao, Sihan, et al.
Published: (2026)
UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment
by: Zhang, Wei, et al.
Published: (2025)
by: Zhang, Wei, et al.
Published: (2025)
Understanding the Vulnerability of Skeleton-based Human Activity Recognition via Black-box Attack
by: Diao, Yunfeng, et al.
Published: (2022)
by: Diao, Yunfeng, et al.
Published: (2022)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
by: Wang, Yibin, et al.
Published: (2024)
by: Wang, Yibin, et al.
Published: (2024)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
by: Li, Yuliang, et al.
Published: (2026)
by: Li, Yuliang, et al.
Published: (2026)
PoseLLM: Enhancing Language-Guided Human Pose Estimation with MLP Alignment
by: Zhang, Dewen, et al.
Published: (2025)
by: Zhang, Dewen, et al.
Published: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
by: Lin, Yan-Bo, et al.
Published: (2024)
by: Lin, Yan-Bo, et al.
Published: (2024)
Similar Items
-
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
by: Yang, Lei, et al.
Published: (2026) -
Semantic Alignment for Multimodal Large Language Models
by: Wu, Tao, et al.
Published: (2024) -
NaVIP: An Image-Centric Indoor Navigation Solution for Visually Impaired People
by: Yu, Jun, et al.
Published: (2024) -
Trusting Semantic Segmentation Networks
by: Some, Samik, et al.
Published: (2024) -
Can Unsupervised Segmentation Reduce Annotation Costs for Video Semantic Segmentation?
by: Some, Samik, et al.
Published: (2026)