Investigating Video Reasoning Capability of Large Language Models with Tropes in Movies
Fuente:
arXiv
Saved in:
| Main Authors: | Su, Hung-Ting, Chao, Chun-Tong, Hsu, Ya-Ching, Lin, Xudong, Niu, Yulei, Lee, Hung-Yi, Hsu, Winston H. |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Unveiling Narrative Reasoning Limits of Large Language Models with Trope in Movie Synopses
by: Su, Hung-Ting, et al.
Published: (2024)
by: Su, Hung-Ting, et al.
Published: (2024)
MovieCORE: COgnitive REasoning in Movies
by: Faure, Gueter Josmy, et al.
Published: (2025)
by: Faure, Gueter Josmy, et al.
Published: (2025)
SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning
by: Chunhachatrachai, Pawat, et al.
Published: (2026)
by: Chunhachatrachai, Pawat, et al.
Published: (2026)
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
by: Faure, Gueter Josmy, et al.
Published: (2026)
by: Faure, Gueter Josmy, et al.
Published: (2026)
Tel2Veh: Fusion of Telecom Data and Vehicle Flow to Predict Camera-Free Traffic via a Spatio-Temporal Framework
by: Lin, ChungYi, et al.
Published: (2024)
by: Lin, ChungYi, et al.
Published: (2024)
VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions
by: Su, Hung-Ting, et al.
Published: (2026)
by: Su, Hung-Ting, et al.
Published: (2026)
ADAPT: Benchmarking Commonsense Planning under Unspecified Affordance Constraints
by: Chen, Pei-An, et al.
Published: (2026)
by: Chen, Pei-An, et al.
Published: (2026)
SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization
by: Chen, Posheng, et al.
Published: (2026)
by: Chen, Posheng, et al.
Published: (2026)
Evaluating Cultural Knowledge Processing in Large Language Models: A Cognitive Benchmarking Framework Integrating Retrieval-Augmented Generation
by: Lee, Hung-Shin, et al.
Published: (2025)
by: Lee, Hung-Shin, et al.
Published: (2025)
Revisiting Semi-supervised Adversarial Robustness via Noise-aware Online Robust Distillation
by: Wu, Tsung-Han, et al.
Published: (2024)
by: Wu, Tsung-Han, et al.
Published: (2024)
Can Large Audio-Language Models Truly Hear? Tackling Hallucinations with Multi-Task Assessment and Stepwise Audio Reasoning
by: Kuan, Chun-Yi, et al.
Published: (2024)
by: Kuan, Chun-Yi, et al.
Published: (2024)
HERMES: temporal-coHERent long-forM understanding with Episodes and Semantics
by: Faure, Gueter Josmy, et al.
Published: (2024)
by: Faure, Gueter Josmy, et al.
Published: (2024)
RPRO: Ranked Preference Reinforcement Optimization for Enhancing Medical QA and Diagnostic Reasoning
by: Hsu, Chia-Hsuan, et al.
Published: (2025)
by: Hsu, Chia-Hsuan, et al.
Published: (2025)
SMILE: Speech Meta In-Context Learning for Low-Resource Language Automatic Speech Recognition
by: Hsu, Ming-Hao, et al.
Published: (2024)
by: Hsu, Ming-Hao, et al.
Published: (2024)
Learnable Gated Temporal Shift Module for Deep Video Inpainting
by: Chang, Ya-Liang, et al.
Published: (2019)
by: Chang, Ya-Liang, et al.
Published: (2019)
RAD-Bench: Evaluating Large Language Models Capabilities in Retrieval Augmented Dialogues
by: Kuo, Tzu-Lin, et al.
Published: (2024)
by: Kuo, Tzu-Lin, et al.
Published: (2024)
Tracking-Assisted Object Detection with Event Cameras
by: Yen, Ting-Kang, et al.
Published: (2024)
by: Yen, Ting-Kang, et al.
Published: (2024)
Contrastive Bi-Projector for Unsupervised Domain Adaption
by: Huang, Lin-Chieh, et al.
Published: (2023)
by: Huang, Lin-Chieh, et al.
Published: (2023)
Teaching Audio-Aware Large Language Models What Does Not Hear: Mitigating Hallucinations through Synthesized Negative Samples
by: Kuan, Chun-Yi, et al.
Published: (2025)
by: Kuan, Chun-Yi, et al.
Published: (2025)
Over-Reasoning and Redundant Calculation of Large Language Models
by: Chiang, Cheng-Han, et al.
Published: (2024)
by: Chiang, Cheng-Han, et al.
Published: (2024)
Enhancing Function-Calling Capabilities in LLMs: Strategies for Prompt Formats, Data Integration, and Multilingual Translation
by: Chen, Yi-Chang, et al.
Published: (2024)
by: Chen, Yi-Chang, et al.
Published: (2024)
Examining Forgetting in Continual Pre-training of Aligned Large Language Models
by: Li, Chen-An, et al.
Published: (2024)
by: Li, Chen-An, et al.
Published: (2024)
SCHEMA: State CHangEs MAtter for Procedure Planning in Instructional Videos
by: Niu, Yulei, et al.
Published: (2024)
by: Niu, Yulei, et al.
Published: (2024)
When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models
by: Li, Chen-An, et al.
Published: (2025)
by: Li, Chen-An, et al.
Published: (2025)
A$^2$TG: Adaptive Anisotropic Textured Gaussians for Efficient 3D Scene Representation
by: Hsu, Sheng-Chi, et al.
Published: (2026)
by: Hsu, Sheng-Chi, et al.
Published: (2026)
Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding
by: Hsu, Tzu-wen, et al.
Published: (2025)
by: Hsu, Tzu-wen, et al.
Published: (2025)
Hearing the Order: Investigating Position Bias in Large Audio-Language Models
by: Lin, Yu-Xiang, et al.
Published: (2025)
by: Lin, Yu-Xiang, et al.
Published: (2025)
Analyzing Information-Seeking Behaviors in a Hakka AI Chatbot: A Cognitive-Pragmatic Study
by: Lee, Chu-Hsuan, et al.
Published: (2025)
by: Lee, Chu-Hsuan, et al.
Published: (2025)
From Persona to Person: Enhancing the Naturalness with Multiple Discourse Relations Graph Learning in Personalized Dialogue Generation
by: Hsu, Chih-Hao, et al.
Published: (2025)
by: Hsu, Chih-Hao, et al.
Published: (2025)
TelTrans: Applying Multi-Type Telecom Data to Transportation Evaluation and Prediction via Multifaceted Graph Modeling
by: Lin, ChungYi, et al.
Published: (2024)
by: Lin, ChungYi, et al.
Published: (2024)
Enhancing Sustainable Urban Mobility Prediction with Telecom Data: A Spatio-Temporal Framework Approach
by: Lin, ChungYi, et al.
Published: (2024)
by: Lin, ChungYi, et al.
Published: (2024)
From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data
by: Kuan, Chun-Yi, et al.
Published: (2025)
by: Kuan, Chun-Yi, et al.
Published: (2025)
Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations
by: Lin, Guan-Ting, et al.
Published: (2024)
by: Lin, Guan-Ting, et al.
Published: (2024)
Improving Generalization Ability for 3D Object Detection by Learning Sparsity-invariant Features
by: Lu, Hsin-Cheng, et al.
Published: (2025)
by: Lu, Hsin-Cheng, et al.
Published: (2025)
Understanding Sounds, Missing the Questions: The Challenge of Object Hallucination in Large Audio-Language Models
by: Kuan, Chun-Yi, et al.
Published: (2024)
by: Kuan, Chun-Yi, et al.
Published: (2024)
SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information
by: Yang, Chih-Kai, et al.
Published: (2025)
by: Yang, Chih-Kai, et al.
Published: (2025)
On Calibration of Large Language Models: From Response To Capability
by: Yang, Sin-Han, et al.
Published: (2026)
by: Yang, Sin-Han, et al.
Published: (2026)
Rethinking Dense Sequential Chains: Reasoning Language Models Can Extract Answers from Sparse, Order-Shuffling Chain-of-Thoughts
by: Chen, Yi-Chang, et al.
Published: (2026)
by: Chen, Yi-Chang, et al.
Published: (2026)
Can LLMs Understand the Implication of Emphasized Sentences in Dialogue?
by: Lin, Guan-Ting, et al.
Published: (2024)
by: Lin, Guan-Ting, et al.
Published: (2024)
Progressive Alignment with VLM-LLM Feature to Augment Defect Classification for the ASE Dataset
by: Hsu, Chih-Chung, et al.
Published: (2024)
by: Hsu, Chih-Chung, et al.
Published: (2024)
Similar Items
-
Unveiling Narrative Reasoning Limits of Large Language Models with Trope in Movie Synopses
by: Su, Hung-Ting, et al.
Published: (2024) -
MovieCORE: COgnitive REasoning in Movies
by: Faure, Gueter Josmy, et al.
Published: (2025) -
SPATIOROUTE: Dynamic Prompt Routing for Zero-Shot Spatial Reasoning
by: Chunhachatrachai, Pawat, et al.
Published: (2026) -
FineBench: Benchmarking and Enhancing Vision-Language Models for Fine-grained Human Activity Understanding
by: Faure, Gueter Josmy, et al.
Published: (2026) -
Tel2Veh: Fusion of Telecom Data and Vehicle Flow to Predict Camera-Free Traffic via a Spatio-Temporal Framework
by: Lin, ChungYi, et al.
Published: (2024)