Unlocking Financial Insights: An advanced Multimodal Summarization with Multimodal Output Framework for Financial Advisory Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Das, Sarmistha, Lyngkhoi, R E Zera Marveen, Saha, Sriparna, Maurya, Alka |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
When Words Can't Capture It All: Towards Video-Based User Complaint Text Generation with Multimodal Video Complaint Dataset
par: Das, Sarmistha, et autres
Publié: (2025)
par: Das, Sarmistha, et autres
Publié: (2025)
Deciphering the complaint aspects: Towards an aspect-based complaint identification model with video complaint dataset in finance
par: Das, Sarmistha, et autres
Publié: (2025)
par: Das, Sarmistha, et autres
Publié: (2025)
ToxVidLM: A Multimodal Framework for Toxicity Detection in Code-Mixed Videos
par: Maity, Krishanu, et autres
Publié: (2024)
par: Maity, Krishanu, et autres
Publié: (2024)
Personalized Video Summarization by Multimodal Video Understanding
par: Chen, Brian, et autres
Publié: (2024)
par: Chen, Brian, et autres
Publié: (2024)
Enhancing Adverse Drug Event Detection with Multimodal Dataset: Corpus Creation and Model Development
par: Sahoo, Pranab, et autres
Publié: (2024)
par: Sahoo, Pranab, et autres
Publié: (2024)
Fin-Ally: Pioneering the Development of an Advanced, Commonsense-Embedded Conversational AI for Money Matters
par: Das, Sarmistha, et autres
Publié: (2025)
par: Das, Sarmistha, et autres
Publié: (2025)
QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering
par: Jung, Woojun, et autres
Publié: (2026)
par: Jung, Woojun, et autres
Publié: (2026)
Benchmarking Large Vision-Language Models on CFMME: A Comprehensive Chinese Financial Multimodal Evaluation Dataset
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
Plots Unlock Time-Series Understanding in Multimodal Models
par: Daswani, Mayank, et autres
Publié: (2024)
par: Daswani, Mayank, et autres
Publié: (2024)
GLACIA: Instance-Aware Positional Reasoning for Glacial Lake Segmentation via Multimodal Large Language Model
par: Maurya, Lalit, et autres
Publié: (2025)
par: Maurya, Lalit, et autres
Publié: (2025)
FIND: Toward Multimodal Financial Reasoning and Question Answering for Indic Languages
par: Das, Sarmistha, et autres
Publié: (2026)
par: Das, Sarmistha, et autres
Publié: (2026)
Cut to the Chase: Training-free Multimodal Summarization via Chain-of-Events
par: You, Xiaoxing, et autres
Publié: (2026)
par: You, Xiaoxing, et autres
Publié: (2026)
An Integrated Framework for Multi-Granular Explanation of Video Summarization
par: Tsigos, Konstantinos, et autres
Publié: (2024)
par: Tsigos, Konstantinos, et autres
Publié: (2024)
PosterSum: A Multimodal Benchmark for Scientific Poster Summarization
par: Saxena, Rohit, et autres
Publié: (2025)
par: Saxena, Rohit, et autres
Publié: (2025)
Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs
par: Wang, Wei-Yao, et autres
Publié: (2025)
par: Wang, Wei-Yao, et autres
Publié: (2025)
Localizing Events in Videos with Multimodal Queries
par: Zhang, Gengyuan, et autres
Publié: (2024)
par: Zhang, Gengyuan, et autres
Publié: (2024)
Crossing Borders: A Multimodal Challenge for Indian Poetry Translation and Image Generation
par: Jamil, Sofia, et autres
Publié: (2025)
par: Jamil, Sofia, et autres
Publié: (2025)
VMID: A Multimodal Fusion LLM Framework for Detecting and Identifying Misinformation of Short Videos
par: Zhong, Weihao, et autres
Publié: (2024)
par: Zhong, Weihao, et autres
Publié: (2024)
SD-MVSum: Script-Driven Multimodal Video Summarization Method and Datasets
par: Mylonas, Manolis, et autres
Publié: (2025)
par: Mylonas, Manolis, et autres
Publié: (2025)
MF2Summ: Multimodal Fusion for Video Summarization with Temporal Alignment
par: wang, Shuo, et autres
Publié: (2025)
par: wang, Shuo, et autres
Publié: (2025)
VideoITG: Multimodal Video Understanding with Instructed Temporal Grounding
par: Wang, Shihao, et autres
Publié: (2025)
par: Wang, Shihao, et autres
Publié: (2025)
VideoSAGE: Video Summarization with Graph Representation Learning
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
par: Chaves, Jose M. Rojas, et autres
Publié: (2024)
FCMBench: The First Large-scale Financial Credit Multimodal Benchmark for Real-world Applications
par: Yang, Yehui, et autres
Publié: (2026)
par: Yang, Yehui, et autres
Publié: (2026)
Enhancing Video Summarization with Context Awareness
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
par: Huynh-Lam, Hai-Dang, et autres
Publié: (2024)
ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models
par: Rawte, Vipula, et autres
Publié: (2024)
par: Rawte, Vipula, et autres
Publié: (2024)
UBiSS: A Unified Framework for Bimodal Semantic Summarization of Videos
par: Mei, Yuting, et autres
Publié: (2024)
par: Mei, Yuting, et autres
Publié: (2024)
Exploiting Mixture-of-Experts Redundancy Unlocks Multimodal Generative Abilities
par: Dutt, Raman, et autres
Publié: (2025)
par: Dutt, Raman, et autres
Publié: (2025)
ViBERTgrid BiLSTM-CRF: Multimodal Key Information Extraction from Unstructured Financial Documents
par: Pala, Furkan, et autres
Publié: (2024)
par: Pala, Furkan, et autres
Publié: (2024)
Multimodal Contextualized Support for Enhancing Video Retrieval System
par: Nguyen-Le, Quoc-Bao, et autres
Publié: (2024)
par: Nguyen-Le, Quoc-Bao, et autres
Publié: (2024)
Reasoning-Aware Multimodal Fusion for Hateful Video Detection
par: Yang, Shuonan, et autres
Publié: (2025)
par: Yang, Shuonan, et autres
Publié: (2025)
Multimodal Video Emotion Recognition with Reliable Reasoning Priors
par: Wang, Zhepeng, et autres
Publié: (2025)
par: Wang, Zhepeng, et autres
Publié: (2025)
Apollo: An Exploration of Video Understanding in Large Multimodal Models
par: Zohar, Orr, et autres
Publié: (2024)
par: Zohar, Orr, et autres
Publié: (2024)
COEF-VQ: Cost-Efficient Video Quality Understanding through a Cascaded Multimodal LLM Framework
par: Dong, Xin, et autres
Publié: (2024)
par: Dong, Xin, et autres
Publié: (2024)
DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding
par: Zhang, Peng, et autres
Publié: (2026)
par: Zhang, Peng, et autres
Publié: (2026)
Exploring the Frontier of Vision-Language Models: A Survey of Current Methodologies and Future Directions
par: Ghosh, Akash, et autres
Publié: (2024)
par: Ghosh, Akash, et autres
Publié: (2024)
Comparing Learning Paradigms for Egocentric Video Summarization
par: Wen, Daniel
Publié: (2025)
par: Wen, Daniel
Publié: (2025)
The Role of Visual Modality in Multimodal Mathematical Reasoning: Challenges and Insights
par: Liu, Yufang, et autres
Publié: (2025)
par: Liu, Yufang, et autres
Publié: (2025)
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
par: Nazir, Maham, et autres
Publié: (2026)
par: Nazir, Maham, et autres
Publié: (2026)
Multimodal Language Models for Domain-Specific Procedural Video Summarization
par: Hussain, Nafisa
Publié: (2024)
par: Hussain, Nafisa
Publié: (2024)
VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding
par: Zhang, Zhihong, et autres
Publié: (2025)
par: Zhang, Zhihong, et autres
Publié: (2025)
Documents similaires
-
When Words Can't Capture It All: Towards Video-Based User Complaint Text Generation with Multimodal Video Complaint Dataset
par: Das, Sarmistha, et autres
Publié: (2025) -
Deciphering the complaint aspects: Towards an aspect-based complaint identification model with video complaint dataset in finance
par: Das, Sarmistha, et autres
Publié: (2025) -
ToxVidLM: A Multimodal Framework for Toxicity Detection in Code-Mixed Videos
par: Maity, Krishanu, et autres
Publié: (2024) -
Personalized Video Summarization by Multimodal Video Understanding
par: Chen, Brian, et autres
Publié: (2024) -
Enhancing Adverse Drug Event Detection with Multimodal Dataset: Corpus Creation and Model Development
par: Sahoo, Pranab, et autres
Publié: (2024)