Order Matters: On Parameter-Efficient Image-to-Video Probing for Recognizing Nearly Symmetric Actions
Fuente:
arXiv
Guardado en:
| Autores principales: | Ponbagavathi, Thinesh Thiyakesan, Roitberg, Alina |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Probing Fine-Grained Action Understanding and Cross-View Generalization of Foundation Models
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2024)
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2024)
T-MASK: Temporal Masking for Probing Foundation Models across Camera Views in Driver Monitoring
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2025)
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2025)
Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2026)
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2026)
Structured Relational Reasoning for Group Activity Assessment
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2025)
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2025)
Deep Learning for Metabolic Rate Estimation from Biosignals: A Comparative Study of Architectures and Signal Selection
por: Babakhani, Sarvenaz, et al.
Publicado: (2025)
por: Babakhani, Sarvenaz, et al.
Publicado: (2025)
Towards Synthetic Data Generation for Improved Pain Recognition in Videos under Patient Constraints
por: Nasimzada, Jonas, et al.
Publicado: (2024)
por: Nasimzada, Jonas, et al.
Publicado: (2024)
LLMs are Good Action Recognizers
por: Qu, Haoxuan, et al.
Publicado: (2024)
por: Qu, Haoxuan, et al.
Publicado: (2024)
Referring Atomic Video Action Recognition
por: Peng, Kunyu, et al.
Publicado: (2024)
por: Peng, Kunyu, et al.
Publicado: (2024)
Perceive Anything: Recognize, Explain, Caption, and Segment Anything in Images and Videos
por: Lin, Weifeng, et al.
Publicado: (2025)
por: Lin, Weifeng, et al.
Publicado: (2025)
REACT: Recognize Every Action Everywhere All At Once
por: Chappa, Naga VS Raviteja, et al.
Publicado: (2023)
por: Chappa, Naga VS Raviteja, et al.
Publicado: (2023)
Elevating Skeleton-Based Action Recognition with Efficient Multi-Modality Self-Supervision
por: Wei, Yiping, et al.
Publicado: (2023)
por: Wei, Yiping, et al.
Publicado: (2023)
Classification Matters: Improving Video Action Detection with Class-Specific Attention
por: Lee, Jinsung, et al.
Publicado: (2024)
por: Lee, Jinsung, et al.
Publicado: (2024)
Parameter-Efficient Modality-Balanced Symmetric Fusion for Multimodal Remote Sensing Semantic Segmentation
por: Li, Haocheng, et al.
Publicado: (2026)
por: Li, Haocheng, et al.
Publicado: (2026)
Near-light Photometric Stereo with Symmetric Lights
por: Makabe, Lilika, et al.
Publicado: (2026)
por: Makabe, Lilika, et al.
Publicado: (2026)
Frame Order Matters: A Temporal Sequence-Aware Model for Few-Shot Action Recognition
por: Li, Bozheng, et al.
Publicado: (2024)
por: Li, Bozheng, et al.
Publicado: (2024)
SurgPETL: Parameter-Efficient Image-to-Surgical-Video Transfer Learning for Surgical Phase Recognition
por: Yang, Shu, et al.
Publicado: (2024)
por: Yang, Shu, et al.
Publicado: (2024)
Skeleton-Based Human Action Recognition with Noisy Labels
por: Xu, Yi, et al.
Publicado: (2024)
por: Xu, Yi, et al.
Publicado: (2024)
Learning to Reason and Navigate: Parameter Efficient Action Planning with Large Language Models
por: Mohammadi, Bahram, et al.
Publicado: (2025)
por: Mohammadi, Bahram, et al.
Publicado: (2025)
Towards Scalable Modeling of Compressed Videos for Efficient Action Recognition
por: Biswas, Shristi Das, et al.
Publicado: (2025)
por: Biswas, Shristi Das, et al.
Publicado: (2025)
Recognizing Hand Use and Hand Role at Home After Stroke from Egocentric Video
por: Tsai, Meng-Fen, et al.
Publicado: (2022)
por: Tsai, Meng-Fen, et al.
Publicado: (2022)
ExVideo: Extending Video Diffusion Models via Parameter-Efficient Post-Tuning
por: Duan, Zhongjie, et al.
Publicado: (2024)
por: Duan, Zhongjie, et al.
Publicado: (2024)
Probing the Efficacy of Federated Parameter-Efficient Fine-Tuning of Vision Transformers for Medical Image Classification
por: Alkhunaizi, Naif, et al.
Publicado: (2024)
por: Alkhunaizi, Naif, et al.
Publicado: (2024)
Symmetry Matters: Auditing and Symmetrizing 3D Generative Models
por: Caytuiro, Nicolas, et al.
Publicado: (2025)
por: Caytuiro, Nicolas, et al.
Publicado: (2025)
TransKD: Transformer Knowledge Distillation for Efficient Semantic Segmentation
por: Liu, Ruiping, et al.
Publicado: (2022)
por: Liu, Ruiping, et al.
Publicado: (2022)
Recognizing Artistic Style of Archaeological Image Fragments Using Deep Style Extrapolation
por: Elkin, Gur, et al.
Publicado: (2025)
por: Elkin, Gur, et al.
Publicado: (2025)
Understanding Robustness of Parameter-Efficient Tuning for Image Classification
por: Ruan, Jiacheng, et al.
Publicado: (2024)
por: Ruan, Jiacheng, et al.
Publicado: (2024)
Sample- and Parameter-Efficient Auto-Regressive Image Models
por: Amrani, Elad, et al.
Publicado: (2024)
por: Amrani, Elad, et al.
Publicado: (2024)
Learning Action and Reasoning-Centric Image Editing from Videos and Simulations
por: Krojer, Benno, et al.
Publicado: (2024)
por: Krojer, Benno, et al.
Publicado: (2024)
AdaptiveClick: Clicks-aware Transformer with Adaptive Focal Loss for Interactive Image Segmentation
por: Lin, Jiacheng, et al.
Publicado: (2023)
por: Lin, Jiacheng, et al.
Publicado: (2023)
Action-Guided Attention for Video Action Anticipation
por: Tai, Tsung-Ming, et al.
Publicado: (2026)
por: Tai, Tsung-Ming, et al.
Publicado: (2026)
Learning to Recognize Correctly Completed Procedure Steps in Egocentric Assembly Videos through Spatio-Temporal Modeling
por: Schoonbeek, Tim J., et al.
Publicado: (2025)
por: Schoonbeek, Tim J., et al.
Publicado: (2025)
Recognizing Multiple Ingredients in Food Images Using a Single-Ingredient Classification Model
por: Fu, Kun, et al.
Publicado: (2024)
por: Fu, Kun, et al.
Publicado: (2024)
A Cross-Font Image Retrieval Network for Recognizing Undeciphered Oracle Bone Inscriptions
por: Wu, Zhicong, et al.
Publicado: (2024)
por: Wu, Zhicong, et al.
Publicado: (2024)
TDS-CLIP: Temporal Difference Side Network for Efficient VideoAction Recognition
por: Wang, Bin, et al.
Publicado: (2024)
por: Wang, Bin, et al.
Publicado: (2024)
SVFormer: A Direct Training Spiking Transformer for Efficient Video Action Recognition
por: Yu, Liutao, et al.
Publicado: (2024)
por: Yu, Liutao, et al.
Publicado: (2024)
PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning
por: Xu, Lin, et al.
Publicado: (2024)
por: Xu, Lin, et al.
Publicado: (2024)
Densely Connected Parameter-Efficient Tuning for Referring Image Segmentation
por: Huang, Jiaqi, et al.
Publicado: (2025)
por: Huang, Jiaqi, et al.
Publicado: (2025)
Parameter Efficient Adaptation for Image Restoration with Heterogeneous Mixture-of-Experts
por: Guo, Hang, et al.
Publicado: (2023)
por: Guo, Hang, et al.
Publicado: (2023)
AnimalClue: Recognizing Animals by their Traces
por: Shinoda, Risa, et al.
Publicado: (2025)
por: Shinoda, Risa, et al.
Publicado: (2025)
Recognizing Co-Speech Gestures in-the-Wild
por: Hegde, Sindhu B, et al.
Publicado: (2026)
por: Hegde, Sindhu B, et al.
Publicado: (2026)
Ejemplares similares
-
Probing Fine-Grained Action Understanding and Cross-View Generalization of Foundation Models
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2024) -
T-MASK: Temporal Masking for Probing Foundation Models across Camera Views in Driver Monitoring
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2025) -
Frame2Freq: Spectral Adapters for Fine-Grained Video Understanding
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2026) -
Structured Relational Reasoning for Group Activity Assessment
por: Ponbagavathi, Thinesh Thiyakesan, et al.
Publicado: (2025) -
Deep Learning for Metabolic Rate Estimation from Biosignals: A Comparative Study of Architectures and Signal Selection
por: Babakhani, Sarvenaz, et al.
Publicado: (2025)