On the Efficacy of Text-Based Input Modalities for Action Anticipation
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Beedu, Apoorva, Haresamudram, Harish, Samel, Karan, Essa, Irfan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Exploring Efficient Foundational Multi-modal Models for Video Summarization
par: Samel, Karan, et autres
Publié: (2024)
par: Samel, Karan, et autres
Publié: (2024)
HierSum: A Global and Local Attention Mechanism for Video Summarization
par: Beedu, Apoorva, et autres
Publié: (2025)
par: Beedu, Apoorva, et autres
Publié: (2025)
Limitations in Employing Natural Language Supervision for Sensor-Based Human Activity Recognition -- And Ways to Overcome Them
par: Haresamudram, Harish, et autres
Publié: (2024)
par: Haresamudram, Harish, et autres
Publié: (2024)
Mamba Fusion: Learning Actions Through Questioning
par: Dong, Zhikang, et autres
Publié: (2024)
par: Dong, Zhikang, et autres
Publié: (2024)
GMAIL: Generative Modality Alignment for generated Image Learning
par: Mo, Shentong, et autres
Publié: (2026)
par: Mo, Shentong, et autres
Publié: (2026)
Multi-Modal Zero-Shot Prediction of Color Trajectories in Food Drying
par: Li, Shichen, et autres
Publié: (2025)
par: Li, Shichen, et autres
Publié: (2025)
A Survey of IMU Based Cross-Modal Transfer Learning in Human Activity Recognition
par: Kamboj, Abhi, et autres
Publié: (2024)
par: Kamboj, Abhi, et autres
Publié: (2024)
Separated Inter/Intra-Modal Fusion Prompts for Compositional Zero-Shot Learning
par: Jung, Sua
Publié: (2025)
par: Jung, Sua
Publié: (2025)
Actor-agnostic Multi-label Action Recognition with Multi-modal Query
par: Mondal, Anindya, et autres
Publié: (2023)
par: Mondal, Anindya, et autres
Publié: (2023)
U-Net in Medical Image Segmentation: A Review of Its Applications Across Modalities
par: Neha, Fnu, et autres
Publié: (2024)
par: Neha, Fnu, et autres
Publié: (2024)
CRISP-SAM2: SAM2 with Cross-Modal Interaction and Semantic Prompting for Multi-Organ Segmentation
par: Yu, Xinlei, et autres
Publié: (2025)
par: Yu, Xinlei, et autres
Publié: (2025)
SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation
par: Rapuri, Sampath, et autres
Publié: (2026)
par: Rapuri, Sampath, et autres
Publié: (2026)
StreamDiT: Real-Time Streaming Text-to-Video Generation
par: Kodaira, Akio, et autres
Publié: (2025)
par: Kodaira, Akio, et autres
Publié: (2025)
ClusMFL: A Cluster-Enhanced Framework for Modality-Incomplete Multimodal Federated Learning in Brain Imaging Analysis
par: Wang, Xinpeng, et autres
Publié: (2025)
par: Wang, Xinpeng, et autres
Publié: (2025)
Disease Classification and Impact of Pretrained Deep Convolution Neural Networks on Diverse Medical Imaging Datasets across Imaging Modalities
par: Borah, Jutika, et autres
Publié: (2024)
par: Borah, Jutika, et autres
Publié: (2024)
Realism in Action: Anomaly-Aware Diagnosis of Brain Tumors from Medical Images Using YOLOv8 and DeiT
par: Hashemi, Seyed Mohammad Hossein, et autres
Publié: (2024)
par: Hashemi, Seyed Mohammad Hossein, et autres
Publié: (2024)
A Novel Framework For Text Detection From Natural Scene Images With Complex Background
par: Kaladagi, Basavaraj, et autres
Publié: (2024)
par: Kaladagi, Basavaraj, et autres
Publié: (2024)
LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity
par: Wang, Hongjie, et autres
Publié: (2024)
par: Wang, Hongjie, et autres
Publié: (2024)
Enhancing GANs with Contrastive Learning-Based Multistage Progressive Finetuning SNN and RL-Based External Optimization
par: Mustafa, Osama
Publié: (2024)
par: Mustafa, Osama
Publié: (2024)
Deep Learning-Based Classification of Hyperkinetic Movement Disorders in Children
par: Ramamurthy, Nandika, et autres
Publié: (2024)
par: Ramamurthy, Nandika, et autres
Publié: (2024)
Deep Learning-Based Automatic Diagnosis System for Developmental Dysplasia of the Hip
par: Li, Yang, et autres
Publié: (2022)
par: Li, Yang, et autres
Publié: (2022)
From CNNs to Shift-Invariant Twin Models Based on Complex Wavelets
par: Leterme, Hubert, et autres
Publié: (2022)
par: Leterme, Hubert, et autres
Publié: (2022)
Efficient Cutting Tool Wear Segmentation Based on Segment Anything Model
par: Li, Zongshuo, et autres
Publié: (2024)
par: Li, Zongshuo, et autres
Publié: (2024)
Direct Video-Based Spatiotemporal Deep Learning for Cattle Lameness Detection
par: Sohan, Md Fahimuzzman, et autres
Publié: (2025)
par: Sohan, Md Fahimuzzman, et autres
Publié: (2025)
S$^3$F-Net: A Multi-Modal Approach to Medical Image Classification via Spatial-Spectral Summarizer Fusion Network
par: Siddiqui, Md. Saiful Bari, et autres
Publié: (2025)
par: Siddiqui, Md. Saiful Bari, et autres
Publié: (2025)
Vision Transformer-Based Time-Series Image Reconstruction for Cloud-Filling Applications
par: Li, Lujun, et autres
Publié: (2025)
par: Li, Lujun, et autres
Publié: (2025)
Novel AI-Based Quantification of Breast Arterial Calcification to Predict Cardiovascular Risk
par: Dapamede, Theodorus, et autres
Publié: (2025)
par: Dapamede, Theodorus, et autres
Publié: (2025)
Unit-Based Histopathology Tissue Segmentation via Multi-Level Feature Representation
par: Shakarami, Ashkan, et autres
Publié: (2025)
par: Shakarami, Ashkan, et autres
Publié: (2025)
DepViT-CAD: Deployable Vision Transformer-Based Cancer Diagnosis in Histopathology
par: Shakarami, Ashkan, et autres
Publié: (2025)
par: Shakarami, Ashkan, et autres
Publié: (2025)
Random Walks with Tweedie: A Unified View of Score-Based Diffusion Models
par: Park, Chicago Y., et autres
Publié: (2024)
par: Park, Chicago Y., et autres
Publié: (2024)
Generative Model-Based Fusion for Improved Few-Shot Semantic Segmentation of Infrared Images
par: Yun, Junno, et autres
Publié: (2024)
par: Yun, Junno, et autres
Publié: (2024)
Automated Web-Based Malaria Detection System with Machine Learning and Deep Learning Techniques
par: Taye, Abraham G, et autres
Publié: (2024)
par: Taye, Abraham G, et autres
Publié: (2024)
A Novel Momentum-Based Deep Learning Techniques for Medical Image Classification and Segmentation
par: Biswas, Koushik, et autres
Publié: (2024)
par: Biswas, Koushik, et autres
Publié: (2024)
LoftUp: Learning a Coordinate-Based Feature Upsampler for Vision Foundation Models
par: Huang, Haiwen, et autres
Publié: (2025)
par: Huang, Haiwen, et autres
Publié: (2025)
Efficient Edge-Compatible CNN for Speckle-Based Material Recognition in Laser Cutting Systems
par: Salem, Mohamed Abdallah, et autres
Publié: (2025)
par: Salem, Mohamed Abdallah, et autres
Publié: (2025)
A Deep Convolutional Neural Network-Based Novel Class Balancing for Imbalance Data Segmentation
par: Kalsoom, Atifa, et autres
Publié: (2025)
par: Kalsoom, Atifa, et autres
Publié: (2025)
Drone-Based Multispectral Imaging and Deep Learning for Timely Detection of Branched Broomrape in Tomato Farms
par: Narimani, Mohammadreza, et autres
Publié: (2025)
par: Narimani, Mohammadreza, et autres
Publié: (2025)
An Enhanced Classification Method Based on Adaptive Multi-Scale Fusion for Long-tailed Multispectral Point Clouds
par: Liu, TianZhu, et autres
Publié: (2024)
par: Liu, TianZhu, et autres
Publié: (2024)
Deep Learning-Based Breast Cancer Detection in Mammography: A Multi-Center Validation Study in Thai Population
par: Chamveha, Isarun, et autres
Publié: (2025)
par: Chamveha, Isarun, et autres
Publié: (2025)
Text-to-3D Gaussian Splatting with Physics-Grounded Motion Generation
par: Wang, Wenqing, et autres
Publié: (2024)
par: Wang, Wenqing, et autres
Publié: (2024)
Documents similaires
-
Exploring Efficient Foundational Multi-modal Models for Video Summarization
par: Samel, Karan, et autres
Publié: (2024) -
HierSum: A Global and Local Attention Mechanism for Video Summarization
par: Beedu, Apoorva, et autres
Publié: (2025) -
Limitations in Employing Natural Language Supervision for Sensor-Based Human Activity Recognition -- And Ways to Overcome Them
par: Haresamudram, Harish, et autres
Publié: (2024) -
Mamba Fusion: Learning Actions Through Questioning
par: Dong, Zhikang, et autres
Publié: (2024) -
GMAIL: Generative Modality Alignment for generated Image Learning
par: Mo, Shentong, et autres
Publié: (2026)