KRAST: Knowledge-Augmented Robotic Action Recognition with Structured Text for Vision-Language Models
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Nguyen, Son Hai, Wang, Diwei, Jang, Jinhyeok, Seo, Hyewon |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Enhancing Gait Video Analysis in Neurodegenerative Diseases by Knowledge Augmentation in Vision Language Model
par: Wang, Diwei, et autres
Publié: (2024)
par: Wang, Diwei, et autres
Publié: (2024)
Learning from Oblivion: Predicting Knowledge Overflowed Weights via Retrodiction of Forgetting
par: Jang, Jinhyeok, et autres
Publié: (2025)
par: Jang, Jinhyeok, et autres
Publié: (2025)
AGIR: Assessing 3D Gait Impairment with Reasoning based on LLMs
par: Wang, Diwei, et autres
Publié: (2025)
par: Wang, Diwei, et autres
Publié: (2025)
Conformal Predictions for Human Action Recognition with Vision-Language Models
par: Tim, Bary, et autres
Publié: (2025)
par: Tim, Bary, et autres
Publié: (2025)
Vision-Aware Text Features in Referring Image Segmentation: From Object Understanding to Context Understanding
par: Nguyen-Truong, Hai, et autres
Publié: (2024)
par: Nguyen-Truong, Hai, et autres
Publié: (2024)
RAD: Retrieval-Augmented Decision-Making of Meta-Actions with Vision-Language Models in Autonomous Driving
par: Wang, Yujin, et autres
Publié: (2025)
par: Wang, Yujin, et autres
Publié: (2025)
VLADriver-RAG: Retrieval-Augmented Vision-Language-Action Models for Autonomous Driving
par: Zhao, Rui, et autres
Publié: (2026)
par: Zhao, Rui, et autres
Publié: (2026)
WAVER: Writing-style Agnostic Text-Video Retrieval via Distilling Vision-Language Models Through Open-Vocabulary Knowledge
par: Le, Huy, et autres
Publié: (2023)
par: Le, Huy, et autres
Publié: (2023)
Global Prior Meets Local Consistency: Dual-Memory Augmented Vision-Language-Action Model for Efficient Robotic Manipulation
par: Li, Zaijing, et autres
Publié: (2026)
par: Li, Zaijing, et autres
Publié: (2026)
Rigidity-Aware 3D Gaussian Deformation from a Single Image
par: Kim, Jinhyeok, et autres
Publié: (2025)
par: Kim, Jinhyeok, et autres
Publié: (2025)
Explainable Adversarial-Robust Vision-Language-Action Model for Robotic Manipulation
par: Kim, Ju-Young, et autres
Publié: (2025)
par: Kim, Ju-Young, et autres
Publié: (2025)
AugVLA-3D: Depth-Driven Feature Augmentation for Vision-Language-Action Models
par: Rao, Zhifeng, et autres
Publié: (2026)
par: Rao, Zhifeng, et autres
Publié: (2026)
Robotic State Recognition with Image-to-Text Retrieval Task of Pre-Trained Vision-Language Model and Black-Box Optimization
par: Kawaharazuka, Kento, et autres
Publié: (2024)
par: Kawaharazuka, Kento, et autres
Publié: (2024)
VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models
par: Zhang, Jianke, et autres
Publié: (2026)
par: Zhang, Jianke, et autres
Publié: (2026)
ROSA: Harnessing Robot States for Vision-Language and Action Alignment
par: Wen, Yuqing, et autres
Publié: (2025)
par: Wen, Yuqing, et autres
Publié: (2025)
When Robots Obey the Patch: Universal Transferable Patch Attacks on Vision-Language-Action Models
par: Lu, Hui, et autres
Publié: (2025)
par: Lu, Hui, et autres
Publié: (2025)
ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport
par: Tran, Quoc-Khang, et autres
Publié: (2026)
par: Tran, Quoc-Khang, et autres
Publié: (2026)
A Unified Debiasing Approach for Vision-Language Models across Modalities and Tasks
par: Jung, Hoin, et autres
Publié: (2024)
par: Jung, Hoin, et autres
Publié: (2024)
Learning Vision-Language-Action World Models for Autonomous Driving
par: Wang, Guoqing, et autres
Publié: (2026)
par: Wang, Guoqing, et autres
Publié: (2026)
RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness
par: Park, Junghyun, et autres
Publié: (2025)
par: Park, Junghyun, et autres
Publié: (2025)
Skeleton-Based Action Recognition with Spatial-Structural Graph Convolution
par: Wang, Jingyao, et autres
Publié: (2024)
par: Wang, Jingyao, et autres
Publié: (2024)
Enhancing Action Recognition by Leveraging the Hierarchical Structure of Actions and Textual Context
par: Benavent-Lledo, Manuel, et autres
Publié: (2024)
par: Benavent-Lledo, Manuel, et autres
Publié: (2024)
Knowledge-Augmented Vision Language Models for Underwater Bioacoustic Spectrogram Analysis
par: Nihal, Ragib Amin, et autres
Publié: (2025)
par: Nihal, Ragib Amin, et autres
Publié: (2025)
Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models
par: Kim, Mingyeong, et autres
Publié: (2026)
par: Kim, Mingyeong, et autres
Publié: (2026)
Variational Contrastive Learning for Skeleton-based Action Recognition
par: Nguyen, Dang Dinh, et autres
Publié: (2026)
par: Nguyen, Dang Dinh, et autres
Publié: (2026)
Single-Teacher View Augmentation: Boosting Knowledge Distillation via Angular Diversity
par: Yu, Seonghoon, et autres
Publié: (2025)
par: Yu, Seonghoon, et autres
Publié: (2025)
Robotic Environmental State Recognition with Pre-Trained Vision-Language Models and Black-Box Optimization
par: Kawaharazuka, Kento, et autres
Publié: (2024)
par: Kawaharazuka, Kento, et autres
Publié: (2024)
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
par: Chen, Peng, et autres
Publié: (2025)
par: Chen, Peng, et autres
Publié: (2025)
VLA-OS: Structuring and Dissecting Planning Representations and Paradigms in Vision-Language-Action Models
par: Gao, Chongkai, et autres
Publié: (2025)
par: Gao, Chongkai, et autres
Publié: (2025)
When Alignment Fails: Multimodal Adversarial Attacks on Vision-Language-Action Models
par: Yan, Yuping, et autres
Publié: (2025)
par: Yan, Yuping, et autres
Publié: (2025)
ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models
par: Tang, Zuojin, et autres
Publié: (2026)
par: Tang, Zuojin, et autres
Publié: (2026)
Towards Cross-modal Backward-compatible Representation Learning for Vision-Language Models
par: Jang, Young Kyun, et autres
Publié: (2024)
par: Jang, Young Kyun, et autres
Publié: (2024)
When Text Hijacks Vision: Benchmarking and Mitigating Text Overlay-Induced Hallucination in Vision Language Models
par: Yakun, Cui, et autres
Publié: (2026)
par: Yakun, Cui, et autres
Publié: (2026)
Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models
par: Woo, Sangmin, et autres
Publié: (2024)
par: Woo, Sangmin, et autres
Publié: (2024)
Text Speaks Louder than Vision: ASCII Art Reveals Textual Biases in Vision-Language Models
par: Wang, Zhaochen, et autres
Publié: (2025)
par: Wang, Zhaochen, et autres
Publié: (2025)
Compound Expression Recognition via Large Vision-Language Models
par: Yu, Jun, et autres
Publié: (2025)
par: Yu, Jun, et autres
Publié: (2025)
Mantis: A Versatile Vision-Language-Action Model with Disentangled Visual Foresight
par: Yang, Yi, et autres
Publié: (2025)
par: Yang, Yi, et autres
Publié: (2025)
CF-VLA: Efficient Coarse-to-Fine Action Generation for Vision-Language-Action Policies
par: Du, Fan, et autres
Publié: (2026)
par: Du, Fan, et autres
Publié: (2026)
GMAT: Grounded Multi-Agent Clinical Description Generation for Text Encoder in Vision-Language MIL for Whole Slide Image Classification
par: Quang, Ngoc Bui Lam, et autres
Publié: (2025)
par: Quang, Ngoc Bui Lam, et autres
Publié: (2025)
LIBERO-X: Robustness Litmus for Vision-Language-Action Models
par: Wang, Guodong, et autres
Publié: (2026)
par: Wang, Guodong, et autres
Publié: (2026)
Documents similaires
-
Enhancing Gait Video Analysis in Neurodegenerative Diseases by Knowledge Augmentation in Vision Language Model
par: Wang, Diwei, et autres
Publié: (2024) -
Learning from Oblivion: Predicting Knowledge Overflowed Weights via Retrodiction of Forgetting
par: Jang, Jinhyeok, et autres
Publié: (2025) -
AGIR: Assessing 3D Gait Impairment with Reasoning based on LLMs
par: Wang, Diwei, et autres
Publié: (2025) -
Conformal Predictions for Human Action Recognition with Vision-Language Models
par: Tim, Bary, et autres
Publié: (2025) -
Vision-Aware Text Features in Referring Image Segmentation: From Object Understanding to Context Understanding
par: Nguyen-Truong, Hai, et autres
Publié: (2024)