Hierarchical and Multimodal Data for Daily Activity Understanding
Fuente:
arXiv
Guardado en:
| Autores principales: | Kaviani, Ghazal, Yarici, Yavuz, Kim, Seulgi, Prabhushankar, Mohit, AlRegib, Ghassan, Solh, Mashhour, Patil, Ameya |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-level and Multi-modal Action Anticipation
por: Kim, Seulgi, et al.
Publicado: (2025)
por: Kim, Seulgi, et al.
Publicado: (2025)
Subject Invariant Contrastive Learning for Human Activity Recognition
por: Yarici, Yavuz, et al.
Publicado: (2025)
por: Yarici, Yavuz, et al.
Publicado: (2025)
Explaining Representation Learning with Perceptual Components
por: Yarici, Yavuz, et al.
Publicado: (2024)
por: Yarici, Yavuz, et al.
Publicado: (2024)
MER-DG: Modality-Entropy Regularization for Multimodal Domain Generalization
por: Yarici, Yavuz, et al.
Publicado: (2026)
por: Yarici, Yavuz, et al.
Publicado: (2026)
Taxes Are All You Need: Integration of Taxonomical Hierarchy Relationships into the Contrastive Loss
por: Kokilepersaud, Kiran, et al.
Publicado: (2024)
por: Kokilepersaud, Kiran, et al.
Publicado: (2024)
Information Router for Mitigating Modality Dominance in Vision-Language Models
por: Kim, Seulgi, et al.
Publicado: (2026)
por: Kim, Seulgi, et al.
Publicado: (2026)
HEX: Hierarchical Emergence Exploitation in Self-Supervised Algorithms
por: Kokilepersaud, Kiran, et al.
Publicado: (2024)
por: Kokilepersaud, Kiran, et al.
Publicado: (2024)
Countering Multi-modal Representation Collapse through Rank-targeted Fusion
por: Kim, Seulgi, et al.
Publicado: (2025)
por: Kim, Seulgi, et al.
Publicado: (2025)
VOICE: Variance of Induced Contrastive Explanations to quantify Uncertainty in Neural Network Interpretability
por: Prabhushankar, Mohit, et al.
Publicado: (2024)
por: Prabhushankar, Mohit, et al.
Publicado: (2024)
Counterfactual Gradients-based Quantification of Prediction Trust in Neural Networks
por: Prabhushankar, Mohit, et al.
Publicado: (2024)
por: Prabhushankar, Mohit, et al.
Publicado: (2024)
RADMI: Latent Information Aggregation as a Proxy for Model Uncertainty
por: Stevens, William, et al.
Publicado: (2026)
por: Stevens, William, et al.
Publicado: (2026)
Evaluating BM3D and NBNet: A Comprehensive Study of Image Denoising Across Multiple Datasets
por: Kaviani, Ghazal, et al.
Publicado: (2024)
por: Kaviani, Ghazal, et al.
Publicado: (2024)
BALD-SAM: Disagreement-based Active Prompting in Interactive Segmentation
por: Chowdhury, Prithwijit, et al.
Publicado: (2026)
por: Chowdhury, Prithwijit, et al.
Publicado: (2026)
Targeting Negative Flips in Active Learning using Validation Sets
por: Benkert, Ryan, et al.
Publicado: (2024)
por: Benkert, Ryan, et al.
Publicado: (2024)
Perceptual Quality-based Model Training under Annotator Label Uncertainty
por: Zhou, Chen, et al.
Publicado: (2024)
por: Zhou, Chen, et al.
Publicado: (2024)
Are Objective Explanatory Evaluation metrics Trustworthy? An Adversarial Analysis
por: Chowdhury, Prithwijit, et al.
Publicado: (2024)
por: Chowdhury, Prithwijit, et al.
Publicado: (2024)
Benchmarking Human and Automated Prompting in the Segment Anything Model
por: Quesada, Jorge, et al.
Publicado: (2024)
por: Quesada, Jorge, et al.
Publicado: (2024)
CRACKS: Crowdsourcing Resources for Analysis and Categorization of Key Subsurface faults
por: Prabhushankar, Mohit, et al.
Publicado: (2024)
por: Prabhushankar, Mohit, et al.
Publicado: (2024)
Gradient based Severity Labeling for Biomarker Classification in OCT
por: Kokilepersaud, Kiran, et al.
Publicado: (2026)
por: Kokilepersaud, Kiran, et al.
Publicado: (2026)
Scale-Aware Self-Supervised Learning for Segmentation of Small and Sparse Structures
por: Quesada, Jorge, et al.
Publicado: (2026)
por: Quesada, Jorge, et al.
Publicado: (2026)
Robust Multimodal Learning via Cross-Modal Proxy Tokens
por: Reza, Md Kaykobad, et al.
Publicado: (2025)
por: Reza, Md Kaykobad, et al.
Publicado: (2025)
A Large-scale Benchmark on Geological Fault Delineation Models: Domain Shift, Training Dynamics, Generalizability, Evaluation and Inferential Behavior
por: Quesada, Jorge, et al.
Publicado: (2025)
por: Quesada, Jorge, et al.
Publicado: (2025)
ReCoGNet: Recurrent Context-Guided Network for 3D MRI Prostate Segmentation
por: Mustafa, Ahmad, et al.
Publicado: (2025)
por: Mustafa, Ahmad, et al.
Publicado: (2025)
Effective Data Selection for Seismic Interpretation through Disagreement
por: Benkert, Ryan, et al.
Publicado: (2024)
por: Benkert, Ryan, et al.
Publicado: (2024)
MMP: Towards Robust Multi-Modal Learning with Masked Modality Projection
por: Nezakati, Niki, et al.
Publicado: (2024)
por: Nezakati, Niki, et al.
Publicado: (2024)
AdaDim: Dimensionality Adaptation for SSL Representational Dynamics
por: Kokilepersaud, Kiran, et al.
Publicado: (2025)
por: Kokilepersaud, Kiran, et al.
Publicado: (2025)
Transitional Uncertainty with Layered Intermediate Predictions
por: Benkert, Ryan, et al.
Publicado: (2024)
por: Benkert, Ryan, et al.
Publicado: (2024)
Intelligent Multi-View Test Time Augmentation
por: Ozturk, Efe, et al.
Publicado: (2024)
por: Ozturk, Efe, et al.
Publicado: (2024)
TrajPRed: Trajectory Prediction with Region-based Relation Learning
por: Zhou, Chen, et al.
Publicado: (2024)
por: Zhou, Chen, et al.
Publicado: (2024)
A unified framework for evaluating the robustness of machine-learning interpretability for prospect risking
por: Chowdhury, Prithwijit, et al.
Publicado: (2026)
por: Chowdhury, Prithwijit, et al.
Publicado: (2026)
FedKPer: Tackling Generalization and Personalization in Medical Federated Learning via Knowledge Personalization
por: Fowler, Zoe, et al.
Publicado: (2026)
por: Fowler, Zoe, et al.
Publicado: (2026)
MINDiff: Mask-Integrated Negative Attention for Controlling Overfitting in Text-to-Image Personalization
por: Jeong, Seulgi, et al.
Publicado: (2025)
por: Jeong, Seulgi, et al.
Publicado: (2025)
Towards Comprehensive Real-Time Scene Understanding in Ophthalmic Surgery through Multimodal Image Fusion
por: Rohrmoser, Nikolo, et al.
Publicado: (2026)
por: Rohrmoser, Nikolo, et al.
Publicado: (2026)
SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models
por: Reza, Md Kaykobad, et al.
Publicado: (2026)
por: Reza, Md Kaykobad, et al.
Publicado: (2026)
Watch and Learn: Leveraging Expert Knowledge and Language for Surgical Video Understanding
por: Gastager, David, et al.
Publicado: (2025)
por: Gastager, David, et al.
Publicado: (2025)
MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding
por: Alawode, Basit, et al.
Publicado: (2026)
por: Alawode, Basit, et al.
Publicado: (2026)
State-Space Hierarchical Compression with Gated Attention and Learnable Sampling for Hour-Long Video Understanding in Large Multimodal Models
por: Kim, Geewook, et al.
Publicado: (2025)
por: Kim, Geewook, et al.
Publicado: (2025)
HAVEN: Hierarchically Aligned Multimodal Benchmark for Unified Video Understanding
por: Shi, Mengqi, et al.
Publicado: (2026)
por: Shi, Mengqi, et al.
Publicado: (2026)
Hierarchy-Aware Multimodal Unlearning for Medical AI
por: Wu, Fengli, et al.
Publicado: (2025)
por: Wu, Fengli, et al.
Publicado: (2025)
Quality-Guided Semi-Supervised Learning for Medical Image Segmentation
por: Abhishek, Kumar, et al.
Publicado: (2026)
por: Abhishek, Kumar, et al.
Publicado: (2026)
Ejemplares similares
-
Multi-level and Multi-modal Action Anticipation
por: Kim, Seulgi, et al.
Publicado: (2025) -
Subject Invariant Contrastive Learning for Human Activity Recognition
por: Yarici, Yavuz, et al.
Publicado: (2025) -
Explaining Representation Learning with Perceptual Components
por: Yarici, Yavuz, et al.
Publicado: (2024) -
MER-DG: Modality-Entropy Regularization for Multimodal Domain Generalization
por: Yarici, Yavuz, et al.
Publicado: (2026) -
Taxes Are All You Need: Integration of Taxonomical Hierarchy Relationships into the Contrastive Loss
por: Kokilepersaud, Kiran, et al.
Publicado: (2024)