Salvato in:
| Autori principali: | Yan, Hua, Tan, Heng, Ding, Yi, Zhou, Pengfei, Namboodiri, Vinod, Yang, Yu |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2410.00003 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
di: Yang, Lei, et al.
Pubblicazione: (2026)
di: Yang, Lei, et al.
Pubblicazione: (2026)
Semantic Alignment for Multimodal Large Language Models
di: Wu, Tao, et al.
Pubblicazione: (2024)
di: Wu, Tao, et al.
Pubblicazione: (2024)
NaVIP: An Image-Centric Indoor Navigation Solution for Visually Impaired People
di: Yu, Jun, et al.
Pubblicazione: (2024)
di: Yu, Jun, et al.
Pubblicazione: (2024)
Trusting Semantic Segmentation Networks
di: Some, Samik, et al.
Pubblicazione: (2024)
di: Some, Samik, et al.
Pubblicazione: (2024)
Can Unsupervised Segmentation Reduce Annotation Costs for Video Semantic Segmentation?
di: Some, Samik, et al.
Pubblicazione: (2026)
di: Some, Samik, et al.
Pubblicazione: (2026)
Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment
di: Cui, Feng-Qi, et al.
Pubblicazione: (2025)
di: Cui, Feng-Qi, et al.
Pubblicazione: (2025)
Zero-Shot Skeleton-Based Action Recognition With Prototype-Guided Feature Alignment
di: Zhou, Kai, et al.
Pubblicazione: (2025)
di: Zhou, Kai, et al.
Pubblicazione: (2025)
MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition
di: Zhao, Weichao, et al.
Pubblicazione: (2024)
di: Zhao, Weichao, et al.
Pubblicazione: (2024)
Assessment of Multimodal Large Language Models in Alignment with Human Values
di: Shi, Zhelun, et al.
Pubblicazione: (2024)
di: Shi, Zhelun, et al.
Pubblicazione: (2024)
Frequency-Enhanced Diffusion Models: Curriculum-Guided Semantic Alignment for Zero-Shot Skeleton Action Recognition
di: Zhou, Yuxi, et al.
Pubblicazione: (2026)
di: Zhou, Yuxi, et al.
Pubblicazione: (2026)
Uncertainty and Energy based Loss Guided Semi-Supervised Semantic Segmentation
di: Thakur, Rini Smita, et al.
Pubblicazione: (2025)
di: Thakur, Rini Smita, et al.
Pubblicazione: (2025)
Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model
di: Dong, Jihao, et al.
Pubblicazione: (2024)
di: Dong, Jihao, et al.
Pubblicazione: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
di: Wu, Yuhang, et al.
Pubblicazione: (2024)
Self-supervised Representation Learning for Cell Event Recognition through Time Arrow Prediction
di: Chen, Cangxiong, et al.
Pubblicazione: (2024)
di: Chen, Cangxiong, et al.
Pubblicazione: (2024)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
di: Liu, Yang, et al.
Pubblicazione: (2024)
di: Liu, Yang, et al.
Pubblicazione: (2024)
MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment
di: Das, Anurag, et al.
Pubblicazione: (2024)
di: Das, Anurag, et al.
Pubblicazione: (2024)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
di: Kim, Jeonghwan, et al.
Pubblicazione: (2024)
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
di: He, Hulingxiao, et al.
Pubblicazione: (2026)
di: He, Hulingxiao, et al.
Pubblicazione: (2026)
SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models
di: Wang, Haobo, et al.
Pubblicazione: (2026)
di: Wang, Haobo, et al.
Pubblicazione: (2026)
Multi-Text Guided Few-Shot Semantic Segmentation
di: Jiao, Qiang, et al.
Pubblicazione: (2025)
di: Jiao, Qiang, et al.
Pubblicazione: (2025)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
di: Park, Sungjune, et al.
Pubblicazione: (2025)
di: Park, Sungjune, et al.
Pubblicazione: (2025)
StyleYourSmile: Cross-Domain Face Retargeting Without Paired Multi-Style Data
di: Dey, Avirup, et al.
Pubblicazione: (2025)
di: Dey, Avirup, et al.
Pubblicazione: (2025)
Fusion2Print: Deep Flash-Non-Flash Fusion for Contactless Fingerprint Matching
di: Sahoo, Roja, et al.
Pubblicazione: (2026)
di: Sahoo, Roja, et al.
Pubblicazione: (2026)
CLIP Adaptation by Intra-modal Overlap Reduction
di: Kravets, Alexey, et al.
Pubblicazione: (2024)
di: Kravets, Alexey, et al.
Pubblicazione: (2024)
TalkLoRA: Low-Rank Adaptation for Speech-Driven Animation
di: Saunders, Jack, et al.
Pubblicazione: (2024)
di: Saunders, Jack, et al.
Pubblicazione: (2024)
Zero-Shot Class Unlearning in CLIP with Synthetic Samples
di: Kravets, A., et al.
Pubblicazione: (2024)
di: Kravets, A., et al.
Pubblicazione: (2024)
Illumination-Aware Contactless Fingerprint Spoof Detection via Paired Flash-Non-Flash Imaging
di: Sahoo, Roja, et al.
Pubblicazione: (2026)
di: Sahoo, Roja, et al.
Pubblicazione: (2026)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
di: Yan, Ziang, et al.
Pubblicazione: (2024)
di: Yan, Ziang, et al.
Pubblicazione: (2024)
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
di: Zhang, Xinyao, et al.
Pubblicazione: (2026)
di: Zhang, Xinyao, et al.
Pubblicazione: (2026)
Diverse Semantics-Guided Feature Alignment and Decoupling for Visible-Infrared Person Re-Identification
di: Dong, Neng, et al.
Pubblicazione: (2025)
di: Dong, Neng, et al.
Pubblicazione: (2025)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
di: Peng, Jingwei, et al.
Pubblicazione: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
di: Zhan, Yufei, et al.
Pubblicazione: (2025)
MaskFi: Unsupervised Learning of WiFi and Vision Representations for Multimodal Human Activity Recognition
di: Yang, Jianfei, et al.
Pubblicazione: (2024)
di: Yang, Jianfei, et al.
Pubblicazione: (2024)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
di: Cao, Sihan, et al.
Pubblicazione: (2026)
di: Cao, Sihan, et al.
Pubblicazione: (2026)
UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment
di: Zhang, Wei, et al.
Pubblicazione: (2025)
di: Zhang, Wei, et al.
Pubblicazione: (2025)
Understanding the Vulnerability of Skeleton-based Human Activity Recognition via Black-box Attack
di: Diao, Yunfeng, et al.
Pubblicazione: (2022)
di: Diao, Yunfeng, et al.
Pubblicazione: (2022)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
di: Wang, Yibin, et al.
Pubblicazione: (2024)
di: Wang, Yibin, et al.
Pubblicazione: (2024)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
di: Li, Yuliang, et al.
Pubblicazione: (2026)
di: Li, Yuliang, et al.
Pubblicazione: (2026)
PoseLLM: Enhancing Language-Guided Human Pose Estimation with MLP Alignment
di: Zhang, Dewen, et al.
Pubblicazione: (2025)
di: Zhang, Dewen, et al.
Pubblicazione: (2025)
VMAS: Video-to-Music Generation via Semantic Alignment in Web Music Videos
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
di: Lin, Yan-Bo, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
di: Yang, Lei, et al.
Pubblicazione: (2026) -
Semantic Alignment for Multimodal Large Language Models
di: Wu, Tao, et al.
Pubblicazione: (2024) -
NaVIP: An Image-Centric Indoor Navigation Solution for Visually Impaired People
di: Yu, Jun, et al.
Pubblicazione: (2024) -
Trusting Semantic Segmentation Networks
di: Some, Samik, et al.
Pubblicazione: (2024) -
Can Unsupervised Segmentation Reduce Annotation Costs for Video Semantic Segmentation?
di: Some, Samik, et al.
Pubblicazione: (2026)