Large Language Model-Guided Semantic Alignment for Human Activity Recognition
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yan, Hua, Tan, Heng, Ding, Yi, Zhou, Pengfei, Namboodiri, Vinod, Yang, Yu |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
von: Yang, Lei, et al.
Veröffentlicht: (2026)
von: Yang, Lei, et al.
Veröffentlicht: (2026)
Semantic Alignment for Multimodal Large Language Models
von: Wu, Tao, et al.
Veröffentlicht: (2024)
von: Wu, Tao, et al.
Veröffentlicht: (2024)
Trusting Semantic Segmentation Networks
von: Some, Samik, et al.
Veröffentlicht: (2024)
von: Some, Samik, et al.
Veröffentlicht: (2024)
Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment
von: Cui, Feng-Qi, et al.
Veröffentlicht: (2025)
von: Cui, Feng-Qi, et al.
Veröffentlicht: (2025)
NaVIP: An Image-Centric Indoor Navigation Solution for Visually Impaired People
von: Yu, Jun, et al.
Veröffentlicht: (2024)
von: Yu, Jun, et al.
Veröffentlicht: (2024)
MASA: Motion-aware Masked Autoencoder with Semantic Alignment for Sign Language Recognition
von: Zhao, Weichao, et al.
Veröffentlicht: (2024)
von: Zhao, Weichao, et al.
Veröffentlicht: (2024)
Can Unsupervised Segmentation Reduce Annotation Costs for Video Semantic Segmentation?
von: Some, Samik, et al.
Veröffentlicht: (2026)
von: Some, Samik, et al.
Veröffentlicht: (2026)
Zero-Shot Skeleton-Based Action Recognition With Prototype-Guided Feature Alignment
von: Zhou, Kai, et al.
Veröffentlicht: (2025)
von: Zhou, Kai, et al.
Veröffentlicht: (2025)
Assessment of Multimodal Large Language Models in Alignment with Human Values
von: Shi, Zhelun, et al.
Veröffentlicht: (2024)
von: Shi, Zhelun, et al.
Veröffentlicht: (2024)
Frequency-Enhanced Diffusion Models: Curriculum-Guided Semantic Alignment for Zero-Shot Skeleton Action Recognition
von: Zhou, Yuxi, et al.
Veröffentlicht: (2026)
von: Zhou, Yuxi, et al.
Veröffentlicht: (2026)
Exploring Interactive Semantic Alignment for Efficient HOI Detection with Vision-language Model
von: Dong, Jihao, et al.
Veröffentlicht: (2024)
von: Dong, Jihao, et al.
Veröffentlicht: (2024)
Uncertainty and Energy based Loss Guided Semi-Supervised Semantic Segmentation
von: Thakur, Rini Smita, et al.
Veröffentlicht: (2025)
von: Thakur, Rini Smita, et al.
Veröffentlicht: (2025)
PiTe: Pixel-Temporal Alignment for Large Video-Language Model
von: Liu, Yang, et al.
Veröffentlicht: (2024)
von: Liu, Yang, et al.
Veröffentlicht: (2024)
MTA-CLIP: Language-Guided Semantic Segmentation with Mask-Text Alignment
von: Das, Anurag, et al.
Veröffentlicht: (2024)
von: Das, Anurag, et al.
Veröffentlicht: (2024)
AlignMMBench: Evaluating Chinese Multimodal Alignment in Large Vision-Language Models
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
von: Wu, Yuhang, et al.
Veröffentlicht: (2024)
SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models
von: Wang, Haobo, et al.
Veröffentlicht: (2026)
von: Wang, Haobo, et al.
Veröffentlicht: (2026)
Remote Sensing Large Vision-Language Model: Semantic-augmented Multi-level Alignment and Semantic-aware Expert Modeling
von: Park, Sungjune, et al.
Veröffentlicht: (2025)
von: Park, Sungjune, et al.
Veröffentlicht: (2025)
Finer: Investigating and Enhancing Fine-Grained Visual Concept Recognition in Large Vision Language Models
von: Kim, Jeonghwan, et al.
Veröffentlicht: (2024)
von: Kim, Jeonghwan, et al.
Veröffentlicht: (2024)
Self-supervised Representation Learning for Cell Event Recognition through Time Arrow Prediction
von: Chen, Cangxiong, et al.
Veröffentlicht: (2024)
von: Chen, Cangxiong, et al.
Veröffentlicht: (2024)
Taxonomy-Aware Representation Alignment for Hierarchical Visual Recognition with Large Multimodal Models
von: He, Hulingxiao, et al.
Veröffentlicht: (2026)
von: He, Hulingxiao, et al.
Veröffentlicht: (2026)
Multi-Text Guided Few-Shot Semantic Segmentation
von: Jiao, Qiang, et al.
Veröffentlicht: (2025)
von: Jiao, Qiang, et al.
Veröffentlicht: (2025)
Leveraging Vision-Language Large Models for Interpretable Video Action Recognition with Semantic Tokenization
von: Peng, Jingwei, et al.
Veröffentlicht: (2025)
von: Peng, Jingwei, et al.
Veröffentlicht: (2025)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
von: Yan, Ziang, et al.
Veröffentlicht: (2024)
von: Yan, Ziang, et al.
Veröffentlicht: (2024)
SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing
von: Zhang, Xinyao, et al.
Veröffentlicht: (2026)
von: Zhang, Xinyao, et al.
Veröffentlicht: (2026)
Diverse Semantics-Guided Feature Alignment and Decoupling for Visible-Infrared Person Re-Identification
von: Dong, Neng, et al.
Veröffentlicht: (2025)
von: Dong, Neng, et al.
Veröffentlicht: (2025)
Language-Guided Token Compression with Reinforcement Learning in Large Vision-Language Models
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
von: Cao, Sihan, et al.
Veröffentlicht: (2026)
MaskFi: Unsupervised Learning of WiFi and Vision Representations for Multimodal Human Activity Recognition
von: Yang, Jianfei, et al.
Veröffentlicht: (2024)
von: Yang, Jianfei, et al.
Veröffentlicht: (2024)
UniFit: Towards Universal Virtual Try-on with MLLM-Guided Semantic Alignment
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
von: Zhang, Wei, et al.
Veröffentlicht: (2025)
PoseLLM: Enhancing Language-Guided Human Pose Estimation with MLP Alignment
von: Zhang, Dewen, et al.
Veröffentlicht: (2025)
von: Zhang, Dewen, et al.
Veröffentlicht: (2025)
Beyond Label Semantics: Language-Guided Action Anatomy for Few-shot Action Recognition
von: Qian, Zefeng, et al.
Veröffentlicht: (2025)
von: Qian, Zefeng, et al.
Veröffentlicht: (2025)
Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
von: Zhan, Yufei, et al.
Veröffentlicht: (2025)
Understanding the Vulnerability of Skeleton-based Human Activity Recognition via Black-box Attack
von: Diao, Yunfeng, et al.
Veröffentlicht: (2022)
von: Diao, Yunfeng, et al.
Veröffentlicht: (2022)
LiFT: Leveraging Human Feedback for Text-to-Video Model Alignment
von: Wang, Yibin, et al.
Veröffentlicht: (2024)
von: Wang, Yibin, et al.
Veröffentlicht: (2024)
Read Pointer Meters in complex environments based on a Human-like Alignment and Recognition Algorithm
von: Shu, Yan, et al.
Veröffentlicht: (2023)
von: Shu, Yan, et al.
Veröffentlicht: (2023)
DAGait: Generalized Skeleton-Guided Data Alignment for Gait Recognition
von: Wu, Zhengxian, et al.
Veröffentlicht: (2025)
von: Wu, Zhengxian, et al.
Veröffentlicht: (2025)
PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models
von: Li, Yuliang, et al.
Veröffentlicht: (2026)
von: Li, Yuliang, et al.
Veröffentlicht: (2026)
More Is Better: A MoE-Based Emotion Recognition Framework with Human Preference Alignment
von: Xie, Jun, et al.
Veröffentlicht: (2025)
von: Xie, Jun, et al.
Veröffentlicht: (2025)
StyleYourSmile: Cross-Domain Face Retargeting Without Paired Multi-Style Data
von: Dey, Avirup, et al.
Veröffentlicht: (2025)
von: Dey, Avirup, et al.
Veröffentlicht: (2025)
Fusion2Print: Deep Flash-Non-Flash Fusion for Contactless Fingerprint Matching
von: Sahoo, Roja, et al.
Veröffentlicht: (2026)
von: Sahoo, Roja, et al.
Veröffentlicht: (2026)
CLIP Adaptation by Intra-modal Overlap Reduction
von: Kravets, Alexey, et al.
Veröffentlicht: (2024)
von: Kravets, Alexey, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
von: Yang, Lei, et al.
Veröffentlicht: (2026) -
Semantic Alignment for Multimodal Large Language Models
von: Wu, Tao, et al.
Veröffentlicht: (2024) -
Trusting Semantic Segmentation Networks
von: Some, Samik, et al.
Veröffentlicht: (2024) -
Generalizing WiFi Gesture Recognition via Large-Model-Aware Semantic Distillation and Alignment
von: Cui, Feng-Qi, et al.
Veröffentlicht: (2025) -
NaVIP: An Image-Centric Indoor Navigation Solution for Visually Impaired People
von: Yu, Jun, et al.
Veröffentlicht: (2024)