Enregistré dans:
| Auteurs principaux: | Mu, Kuan-Chen, Chin, Zhi-Yi, Chiu, Wei-Chen |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2410.04511 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
par: Chin, Zhi-Yi, et autres
Publié: (2024)
par: Chin, Zhi-Yi, et autres
Publié: (2024)
Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding
par: Pu, Muxin, et autres
Publié: (2025)
par: Pu, Muxin, et autres
Publié: (2025)
Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
par: Chin, Zhi-Yi, et autres
Publié: (2023)
par: Chin, Zhi-Yi, et autres
Publié: (2023)
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023)
par: Lin, Jingyang, et autres
Publié: (2023)
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
par: Lee, Yi-Lun, et autres
Publié: (2024)
par: Lee, Yi-Lun, et autres
Publié: (2024)
Multimodal Abstractive Summarization of Instructional Videos with Vision-Language Models
par: Nazir, Maham, et autres
Publié: (2026)
par: Nazir, Maham, et autres
Publié: (2026)
DoraemonGPT: Toward Understanding Dynamic Scenes with Large Language Models (Exemplified as A Video Agent)
par: Yang, Zongxin, et autres
Publié: (2024)
par: Yang, Zongxin, et autres
Publié: (2024)
Unleashing Hour-Scale Video Training for Long Video-Language Understanding
par: Lin, Jingyang, et autres
Publié: (2025)
par: Lin, Jingyang, et autres
Publié: (2025)
Minimal Clips, Maximum Salience: Long Video Summarization via Key Moment Extraction
par: Pennec, Galann, et autres
Publié: (2025)
par: Pennec, Galann, et autres
Publié: (2025)
Semantic Frame Aggregation-based Transformer for Live Video Comment Generation
par: Fatima, Anam, et autres
Publié: (2025)
par: Fatima, Anam, et autres
Publié: (2025)
SignDPO: Multi-level Direct Preference Optimisation for Skeleton-based Gloss-free Sign Language Translation
par: Pu, Muxin, et autres
Publié: (2026)
par: Pu, Muxin, et autres
Publié: (2026)
Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models
par: Chew, Oscar, et autres
Publié: (2026)
par: Chew, Oscar, et autres
Publié: (2026)
MS4UI: A Dataset for Multi-modal Summarization of User Interface Instructional Videos
par: Zang, Yuan, et autres
Publié: (2025)
par: Zang, Yuan, et autres
Publié: (2025)
NeMo: Needle in a Montage for Video-Language Understanding
par: Hu, Zi-Yuan, et autres
Publié: (2025)
par: Hu, Zi-Yuan, et autres
Publié: (2025)
VideoChat: Chat-Centric Video Understanding
par: Li, KunChang, et autres
Publié: (2023)
par: Li, KunChang, et autres
Publié: (2023)
LongVideoBench: A Benchmark for Long-context Interleaved Video-Language Understanding
par: Wu, Haoning, et autres
Publié: (2024)
par: Wu, Haoning, et autres
Publié: (2024)
Towards an Automated Multimodal Approach for Video Summarization: Building a Bridge Between Text, Audio and Facial Cue-Based Summarization
par: Islam, Md Moinul, et autres
Publié: (2025)
par: Islam, Md Moinul, et autres
Publié: (2025)
TOPA: Extending Large Language Models for Video Understanding via Text-Only Pre-Alignment
par: Li, Wei, et autres
Publié: (2024)
par: Li, Wei, et autres
Publié: (2024)
Video Understanding with Large Language Models: A Survey
par: Tang, Yolo Y., et autres
Publié: (2023)
par: Tang, Yolo Y., et autres
Publié: (2023)
Video-LaVIT: Unified Video-Language Pre-training with Decoupled Visual-Motional Tokenization
par: Jin, Yang, et autres
Publié: (2024)
par: Jin, Yang, et autres
Publié: (2024)
VideoARM: Agentic Reasoning over Hierarchical Memory for Long-Form Video Understanding
par: Yin, Yufei, et autres
Publié: (2025)
par: Yin, Yufei, et autres
Publié: (2025)
From Long Videos to Engaging Clips: A Human-Inspired Video Editing Framework with Multimodal Narrative Understanding
par: Wang, Xiangfeng, et autres
Publié: (2025)
par: Wang, Xiangfeng, et autres
Publié: (2025)
Enhancing Meme Emotion Understanding with Multi-Level Modality Enhancement and Dual-Stage Modal Fusion
par: Shi, Yi, et autres
Publié: (2025)
par: Shi, Yi, et autres
Publié: (2025)
Wolf: Dense Video Captioning with a World Summarization Framework
par: Li, Boyi, et autres
Publié: (2024)
par: Li, Boyi, et autres
Publié: (2024)
VLMT: Vision-Language Multimodal Transformer for Multimodal Multi-hop Question Answering
par: Lim, Qi Zhi, et autres
Publié: (2025)
par: Lim, Qi Zhi, et autres
Publié: (2025)
A Novel Trustworthy Video Summarization Algorithm Through a Mixture of LoRA Experts
par: Du, Wenzhuo, et autres
Publié: (2025)
par: Du, Wenzhuo, et autres
Publié: (2025)
ViTCoT: Video-Text Interleaved Chain-of-Thought for Boosting Video Understanding in Large Language Models
par: Zhang, Yongheng, et autres
Publié: (2025)
par: Zhang, Yongheng, et autres
Publié: (2025)
Personalized Video Summarization by Multimodal Video Understanding
par: Chen, Brian, et autres
Publié: (2024)
par: Chen, Brian, et autres
Publié: (2024)
MuLTI: Efficient Video-and-Language Understanding with Text-Guided MultiWay-Sampler and Multiple Choice Modeling
par: Xu, Jiaqi, et autres
Publié: (2023)
par: Xu, Jiaqi, et autres
Publié: (2023)
VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs
par: Cheng, Zesen, et autres
Publié: (2024)
par: Cheng, Zesen, et autres
Publié: (2024)
LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding
par: Luo, Chuwei, et autres
Publié: (2024)
par: Luo, Chuwei, et autres
Publié: (2024)
Summarization of Multimodal Presentations with Vision-Language Models: Study of the Effect of Modalities and Structure
par: Gigant, Théo, et autres
Publié: (2025)
par: Gigant, Théo, et autres
Publié: (2025)
CoTasks: Chain-of-Thought based Video Instruction Tuning Tasks
par: Wang, Yanan, et autres
Publié: (2025)
par: Wang, Yanan, et autres
Publié: (2025)
DaMO: A Data-Efficient Multimodal Orchestrator for Temporal Reasoning with Video LLMs
par: Chiu, Bo-Cheng, et autres
Publié: (2025)
par: Chiu, Bo-Cheng, et autres
Publié: (2025)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
par: Li, Shicheng, et autres
Publié: (2023)
par: Li, Shicheng, et autres
Publié: (2023)
Video Summarization: Towards Entity-Aware Captions
par: Ayyubi, Hammad A., et autres
Publié: (2023)
par: Ayyubi, Hammad A., et autres
Publié: (2023)
Vision Language Models Map Logos to Text via Semantic Entanglement in the Visual Projector
par: Li, Sifan, et autres
Publié: (2025)
par: Li, Sifan, et autres
Publié: (2025)
VideoVista: A Versatile Benchmark for Video Understanding and Reasoning
par: Li, Yunxin, et autres
Publié: (2024)
par: Li, Yunxin, et autres
Publié: (2024)
Exploring the Role of Explicit Temporal Modeling in Multimodal Large Language Models for Video Understanding
par: Li, Yun, et autres
Publié: (2025)
par: Li, Yun, et autres
Publié: (2025)
Improving Language Understanding from Screenshots
par: Gao, Tianyu, et autres
Publié: (2024)
par: Gao, Tianyu, et autres
Publié: (2024)
Documents similaires
-
Red-Teaming Text-to-Image Models via In-Context Experience Replay and Semantic-Preserving Prompt Rewriting
par: Chin, Zhi-Yi, et autres
Publié: (2024) -
Sigma: Semantically Informative Pre-training for Skeleton-based Sign Language Understanding
par: Pu, Muxin, et autres
Publié: (2025) -
Prompting4Debugging: Red-Teaming Text-to-Image Diffusion Models by Finding Problematic Prompts
par: Chin, Zhi-Yi, et autres
Publié: (2023) -
VideoXum: Cross-modal Visual and Textural Summarization of Videos
par: Lin, Jingyang, et autres
Publié: (2023) -
Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models
par: Lee, Yi-Lun, et autres
Publié: (2024)