MMTM: Tri-Modal Topic Modeling for Long-Form Video via Similarity-Gated Fusion
Fuente:
arXiv
Saved in:
| Main Authors: | Abusaleh, Ali, Verma, Bhuvanesh, Mehler, Alexander |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
T3Time: Tri-Modal Time Series Forecasting via Adaptive Multi-Head Alignment and Residual Fusion
by: Chowdhury, Abdul Monaf, et al.
Published: (2025)
by: Chowdhury, Abdul Monaf, et al.
Published: (2025)
The Design Space of Tri-Modal Masked Diffusion Models
by: Bethune, Louis, et al.
Published: (2026)
by: Bethune, Louis, et al.
Published: (2026)
CGCMA: Conditionally-Gated Cross-Modal Attention for Event-Conditioned Asynchronous Fusion
by: Guo, Yunxiang
Published: (2026)
by: Guo, Yunxiang
Published: (2026)
Short-Form Videos and Mental Health: A Knowledge-Guided Neural Topic Model
by: Xie, Jiaheng, et al.
Published: (2024)
by: Xie, Jiaheng, et al.
Published: (2024)
StutterFuse: Mitigating Modality Collapse in Stuttering Detection with Jaccard-Weighted Metric Learning and Gated Fusion
by: Singh, Guransh, et al.
Published: (2025)
by: Singh, Guransh, et al.
Published: (2025)
Factor Analysis with Correlated Topic Model for Multi-Modal Data
by: Łazęcka, Małgorzata, et al.
Published: (2025)
by: Łazęcka, Małgorzata, et al.
Published: (2025)
Robust Multimodal Learning via Entropy-Gated Contrastive Fusion
by: Chlon, Leon, et al.
Published: (2025)
by: Chlon, Leon, et al.
Published: (2025)
STaT: Resolving Shape Distortion in Non-Stationary Time Series via Tri-Modal Synergy
by: Cheng, Hui, et al.
Published: (2026)
by: Cheng, Hui, et al.
Published: (2026)
DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation
by: Lee, Jusuk, et al.
Published: (2026)
by: Lee, Jusuk, et al.
Published: (2026)
Tri-Learn Graph Fusion Network for Attributed Graph Clustering
by: Li, Binxiong, et al.
Published: (2025)
by: Li, Binxiong, et al.
Published: (2025)
Extending a Parliamentary Corpus with MPs' Tweets: Automatic Annotation and Evaluation Using MultiParTweet
by: Bagci, Mevlüt, et al.
Published: (2025)
by: Bagci, Mevlüt, et al.
Published: (2025)
TRIDENT: Tri-Modal Molecular Representation Learning with Taxonomic Annotations and Local Correspondence
by: Jiang, Feng, et al.
Published: (2025)
by: Jiang, Feng, et al.
Published: (2025)
LongViTU: Instruction Tuning for Long-Form Video Understanding
by: Wu, Rujie, et al.
Published: (2025)
by: Wu, Rujie, et al.
Published: (2025)
SPICED: News Similarity Detection Dataset with Multiple Topics and Complexity Levels
by: Shushkevich, Elena, et al.
Published: (2023)
by: Shushkevich, Elena, et al.
Published: (2023)
Infusing Environmental Captions for Long-Form Video Language Grounding
by: Lee, Hyogun, et al.
Published: (2024)
by: Lee, Hyogun, et al.
Published: (2024)
metasnf: Meta Clustering with Similarity Network Fusion in R
by: Velayudhan, Prashanth S, et al.
Published: (2024)
by: Velayudhan, Prashanth S, et al.
Published: (2024)
Gated-Attention Feature-Fusion Based Framework for Poverty Prediction
by: Ramzan, Muhammad Umer, et al.
Published: (2024)
by: Ramzan, Muhammad Umer, et al.
Published: (2024)
FusionSense: Tri-Stage Near-Sensor Learning for Runtime-Adaptive Multimodal Edge Intelligence
by: Yun, Sanggeon, et al.
Published: (2026)
by: Yun, Sanggeon, et al.
Published: (2026)
TripleSumm: Adaptive Triple-Modality Fusion for Video Summarization
by: Kim, Sumin, et al.
Published: (2026)
by: Kim, Sumin, et al.
Published: (2026)
xMTrans: Temporal Attentive Cross-Modality Fusion Transformer for Long-Term Traffic Prediction
by: Ung, Huy Quang, et al.
Published: (2024)
by: Ung, Huy Quang, et al.
Published: (2024)
ProtoTopic: Prototypical Network for Few-Shot Medical Topic Modeling
by: Licht, Martin, et al.
Published: (2025)
by: Licht, Martin, et al.
Published: (2025)
Dual Branch VideoMamba with Gated Class Token Fusion for Violence Detection
by: Senadeera, Damith Chamalke, et al.
Published: (2025)
by: Senadeera, Damith Chamalke, et al.
Published: (2025)
TriFit: Trimodal Fusion with Protein Dynamics for Mutation Fitness Prediction
by: Cho, Seungik
Published: (2026)
by: Cho, Seungik
Published: (2026)
Continual Neural Topic Model
by: James, Charu Karakkaparambil, et al.
Published: (2025)
by: James, Charu Karakkaparambil, et al.
Published: (2025)
Constrained Non-negative Matrix Factorization for Guided Topic Modeling of Minority Topics
by: Ebrahimi, Seyedeh Fatemeh, et al.
Published: (2025)
by: Ebrahimi, Seyedeh Fatemeh, et al.
Published: (2025)
Keyframe-oriented Vision Token Pruning: Enhancing Efficiency of Large Vision Language Models on Long-Form Video Processing
by: Liu, Yudong, et al.
Published: (2025)
by: Liu, Yudong, et al.
Published: (2025)
Large Language Models Decide Early and Explain Later
by: Datta, Ayan, et al.
Published: (2026)
by: Datta, Ayan, et al.
Published: (2026)
Training-Free Query Optimization via LLM-Based Plan Similarity
by: Vasilenko, Nikita, et al.
Published: (2025)
by: Vasilenko, Nikita, et al.
Published: (2025)
Topic-Based Watermarks for Large Language Models
by: Nemecek, Alexander, et al.
Published: (2024)
by: Nemecek, Alexander, et al.
Published: (2024)
Advancing Academic Knowledge Retrieval via LLM-enhanced Representation Similarity Fusion
by: Dai, Wei, et al.
Published: (2024)
by: Dai, Wei, et al.
Published: (2024)
Scaling Vision Language Models for Pharmaceutical Long Form Video Reasoning on Industrial GenAI Platform
by: Mishra, Suyash, et al.
Published: (2026)
by: Mishra, Suyash, et al.
Published: (2026)
Rethinking Gating Mechanism in Sparse MoE: Handling Arbitrary Modality Inputs with Confidence-Guided Gate
by: Zheng, Liangwei Nathan, et al.
Published: (2025)
by: Zheng, Liangwei Nathan, et al.
Published: (2025)
PALTO: Physics-Informed Active Learning for Tri-Gate FinFET Design Optimization for Vertical Power Delivery
by: Sadeghi, Ayoub, et al.
Published: (2026)
by: Sadeghi, Ayoub, et al.
Published: (2026)
Neural Network Graph Similarity Computation Based on Graph Fusion
by: Chang, Zenghui, et al.
Published: (2025)
by: Chang, Zenghui, et al.
Published: (2025)
Enhancing Temporal Modeling of Video LLMs via Time Gating
by: Hu, Zi-Yuan, et al.
Published: (2024)
by: Hu, Zi-Yuan, et al.
Published: (2024)
Communication-Efficient and Personalized Federated Foundation Model Fine-Tuning via Tri-Matrix Adaptation
by: Li, Yongle, et al.
Published: (2025)
by: Li, Yongle, et al.
Published: (2025)
Logit Reweighting for Topic-Focused Summarization
by: Braun, Joschka, et al.
Published: (2025)
by: Braun, Joschka, et al.
Published: (2025)
Improving Pediatric Emergency Department Triage with Modality Dropout in Late Fusion Multimodal EHR Models
by: Yang, Tyler, et al.
Published: (2026)
by: Yang, Tyler, et al.
Published: (2026)
Topic Modeling in Marathi
by: Shinde, Sanket, et al.
Published: (2025)
by: Shinde, Sanket, et al.
Published: (2025)
Virtual Fitting Room: Generating Arbitrarily Long Videos of Virtual Try-On from a Single Image -- Technical Preview
by: Chen, Jun-Kun, et al.
Published: (2025)
by: Chen, Jun-Kun, et al.
Published: (2025)
Similar Items
-
T3Time: Tri-Modal Time Series Forecasting via Adaptive Multi-Head Alignment and Residual Fusion
by: Chowdhury, Abdul Monaf, et al.
Published: (2025) -
The Design Space of Tri-Modal Masked Diffusion Models
by: Bethune, Louis, et al.
Published: (2026) -
CGCMA: Conditionally-Gated Cross-Modal Attention for Event-Conditioned Asynchronous Fusion
by: Guo, Yunxiang
Published: (2026) -
Short-Form Videos and Mental Health: A Knowledge-Guided Neural Topic Model
by: Xie, Jiaheng, et al.
Published: (2024) -
StutterFuse: Mitigating Modality Collapse in Stuttering Detection with Jaccard-Weighted Metric Learning and Gated Fusion
by: Singh, Guransh, et al.
Published: (2025)