FinCap: Topic-Aligned Captions for Short-Form Financial YouTube Videos
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Sukhani, Siddhant, Bhardwaj, Yash, Bhadani, Riya, Kejriwal, Veer, Galarnyk, Michael, Chava, Sudheer |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
VideoConviction: A Multimodal Benchmark for Human Conviction and Stock Market Recommendations
par: Galarnyk, Michael, et autres
Publié: (2025)
par: Galarnyk, Michael, et autres
Publié: (2025)
Language Modeling for the Future of Finance: A Survey into Metrics, Tasks, and Data Opportunities
par: Tatarinov, Nikita, et autres
Publié: (2025)
par: Tatarinov, Nikita, et autres
Publié: (2025)
Shorts on the Rise: Assessing the Effects of YouTube Shorts on Long-Form Video Content
par: Rajendran, Prajit T., et autres
Publié: (2024)
par: Rajendran, Prajit T., et autres
Publié: (2024)
YouTube SFV+HDR Quality Dataset
par: Wang, Yilin, et autres
Publié: (2024)
par: Wang, Yilin, et autres
Publié: (2024)
Video-Mediated Emotion Disclosure: Expressions of Fear, Sadness, and Joy by People with Schizophrenia on YouTube
par: Liu, Jiaying Lizzy, et autres
Publié: (2025)
par: Liu, Jiaying Lizzy, et autres
Publié: (2025)
Harmful YouTube Video Detection: A Taxonomy of Online Harm and MLLMs as Alternative Annotators
par: Jo, Claire Wonjeong, et autres
Publié: (2024)
par: Jo, Claire Wonjeong, et autres
Publié: (2024)
ProCap: Projection-Aware Captioning for Spatial Augmented Reality
par: Cao, Zimo, et autres
Publié: (2026)
par: Cao, Zimo, et autres
Publié: (2026)
SubjECTive-QA: Measuring Subjectivity in Earnings Call Transcripts' QA Through Six-Dimensional Feature Analysis
par: Pardawala, Huzaifa, et autres
Publié: (2024)
par: Pardawala, Huzaifa, et autres
Publié: (2024)
YouTube Video Analytics for Patient Engagement: Evidence from Colonoscopy Preparation Videos
par: Guo, Yawen, et autres
Publié: (2024)
par: Guo, Yawen, et autres
Publié: (2024)
Shorter Is Different: Characterizing the Dynamics of Short-Form Video Platforms
par: Chen, Zhilong, et autres
Publié: (2024)
par: Chen, Zhilong, et autres
Publié: (2024)
FiNER-ORD: Financial Named Entity Recognition Open Research Dataset
par: Shah, Agam, et autres
Publié: (2023)
par: Shah, Agam, et autres
Publié: (2023)
Characterizing Multimedia Information Environment through Multi-modal Clustering of YouTube Videos
par: Yousefi, Niloofar, et autres
Publié: (2024)
par: Yousefi, Niloofar, et autres
Publié: (2024)
MultiHateClip: A Multilingual Benchmark Dataset for Hateful Video Detection on YouTube and Bilibili
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Edit As You Wish: Video Caption Editing with Multi-grained User Control
par: Yao, Linli, et autres
Publié: (2023)
par: Yao, Linli, et autres
Publié: (2023)
YTLive: A Dataset of Real-World YouTube Live Streaming Sessions
par: Mozhganfar, Mojtaba, et autres
Publié: (2025)
par: Mozhganfar, Mojtaba, et autres
Publié: (2025)
FinAudio: A Benchmark for Audio Large Language Models in Financial Applications
par: Cao, Yupeng, et autres
Publié: (2025)
par: Cao, Yupeng, et autres
Publié: (2025)
WavCaps: A ChatGPT-Assisted Weakly-Labelled Audio Captioning Dataset for Audio-Language Multimodal Research
par: Mei, Xinhao, et autres
Publié: (2023)
par: Mei, Xinhao, et autres
Publié: (2023)
Cap2Sum: Learning to Summarize Videos by Generating Captions
par: Zhao, Cairong, et autres
Publié: (2024)
par: Zhao, Cairong, et autres
Publié: (2024)
FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks
par: Cao, Yupeng, et autres
Publié: (2026)
par: Cao, Yupeng, et autres
Publié: (2026)
How Inclusively do LMs Perceive Social and Moral Norms?
par: Galarnyk, Michael, et autres
Publié: (2025)
par: Galarnyk, Michael, et autres
Publié: (2025)
Words That Unite The World: A Unified Framework for Deciphering Central Bank Communications Globally
par: Shah, Agam, et autres
Publié: (2025)
par: Shah, Agam, et autres
Publié: (2025)
Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI Evaluation
par: Gkoumas, Dimitris, et autres
Publié: (2024)
par: Gkoumas, Dimitris, et autres
Publié: (2024)
Hierarchical Aligned Multimodal Learning for NER on Tweet Posts
par: Liu, Peipei, et autres
Publié: (2023)
par: Liu, Peipei, et autres
Publié: (2023)
See or Guess: Counterfactually Regularized Image Captioning
par: Cao, Qian, et autres
Publié: (2024)
par: Cao, Qian, et autres
Publié: (2024)
PolySmart @ TRECVid 2024 Video Captioning (VTT)
par: Wu, Jiaxin, et autres
Publié: (2024)
par: Wu, Jiaxin, et autres
Publié: (2024)
Mitigating Image Captioning Hallucinations in Vision-Language Models
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
OneDiff: A Generalist Model for Image Difference Captioning
par: Hu, Erdong, et autres
Publié: (2024)
par: Hu, Erdong, et autres
Publié: (2024)
Embedded Heterogeneous Attention Transformer for Cross-lingual Image Captioning
par: Song, Zijie, et autres
Publié: (2023)
par: Song, Zijie, et autres
Publié: (2023)
ALMol: Aligned Language-Molecule Translation LLMs through Offline Preference Contrastive Optimisation
par: Gkoumas, Dimitris
Publié: (2024)
par: Gkoumas, Dimitris
Publié: (2024)
On the Robustness of Cover Version Identification Models: A Study Using Cover Versions from YouTube
par: Hachmeier, Simon, et autres
Publié: (2025)
par: Hachmeier, Simon, et autres
Publié: (2025)
MemeCLIP: Leveraging CLIP Representations for Multimodal Meme Classification
par: Shah, Siddhant Bikram, et autres
Publié: (2024)
par: Shah, Siddhant Bikram, et autres
Publié: (2024)
AeroLite: Tag-Guided Lightweight Generation of Aerial Image Captions
par: Zi, Xing, et autres
Publié: (2025)
par: Zi, Xing, et autres
Publié: (2025)
Group-based Distinctive Image Captioning with Memory Difference Encoding and Attention
par: Wang, Jiuniu, et autres
Publié: (2025)
par: Wang, Jiuniu, et autres
Publié: (2025)
Anisotropic Modality Align
par: Yu, Xiaomin, et autres
Publié: (2026)
par: Yu, Xiaomin, et autres
Publié: (2026)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
par: Wang, Xinran, et autres
Publié: (2026)
par: Wang, Xinran, et autres
Publié: (2026)
Dialect and Gender Bias in YouTube's Spanish Captioning System
par: Jimenez, Iris Dania, et autres
Publié: (2026)
par: Jimenez, Iris Dania, et autres
Publié: (2026)
Video Summarization: Towards Entity-Aware Captions
par: Ayyubi, Hammad A., et autres
Publié: (2023)
par: Ayyubi, Hammad A., et autres
Publié: (2023)
Towards Retrieval-Augmented Architectures for Image Captioning
par: Sarto, Sara, et autres
Publié: (2024)
par: Sarto, Sara, et autres
Publié: (2024)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
HAIC: Improving Human Action Understanding and Generation with Better Captions for Multi-modal Large Language Models
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Documents similaires
-
VideoConviction: A Multimodal Benchmark for Human Conviction and Stock Market Recommendations
par: Galarnyk, Michael, et autres
Publié: (2025) -
Language Modeling for the Future of Finance: A Survey into Metrics, Tasks, and Data Opportunities
par: Tatarinov, Nikita, et autres
Publié: (2025) -
Shorts on the Rise: Assessing the Effects of YouTube Shorts on Long-Form Video Content
par: Rajendran, Prajit T., et autres
Publié: (2024) -
YouTube SFV+HDR Quality Dataset
par: Wang, Yilin, et autres
Publié: (2024) -
Video-Mediated Emotion Disclosure: Expressions of Fear, Sadness, and Joy by People with Schizophrenia on YouTube
par: Liu, Jiaying Lizzy, et autres
Publié: (2025)