Friends-MMC: A Dataset for Multi-modal Multi-party Conversation Understanding
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Wang, Yueqian, Meng, Xiaojun, Wang, Yuxuan, Liang, Jianxin, Liu, Qun, Zhao, Dongyan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
par: Liang, Jianxin, et autres
Publié: (2024)
par: Liang, Jianxin, et autres
Publié: (2024)
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
STAIR: Spatial-Temporal Reasoning with Auditable Intermediate Results for Video Question Answering
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
Beyond Isolated Facts: Synthesizing Narrative and Grounded Supervision for VideoQA
par: Liang, Jianxin, et autres
Publié: (2025)
par: Liang, Jianxin, et autres
Publié: (2025)
Understanding Multimodal Hallucination with Parameter-Free Representation Alignment
par: Wang, Yueqian, et autres
Publié: (2024)
par: Wang, Yueqian, et autres
Publié: (2024)
OmniMMI: A Comprehensive Multi-modal Interaction Benchmark in Streaming Video Contexts
par: Wang, Yuxuan, et autres
Publié: (2025)
par: Wang, Yuxuan, et autres
Publié: (2025)
MMDuet2: Enhancing Proactive Interaction of Video MLLMs with Multi-Turn Reinforcement Learning
par: Wang, Yueqian, et autres
Publié: (2025)
par: Wang, Yueqian, et autres
Publié: (2025)
With a Little Help from my (Linguistic) Friends: Topic Segmentation of Multi-party Casual Conversations
par: Decker, Amandine, et autres
Publié: (2024)
par: Decker, Amandine, et autres
Publié: (2024)
ProactiveVideoQA: A Comprehensive Benchmark Evaluating Proactive Interactions in Video Large Language Models
par: Wang, Yueqian, et autres
Publié: (2025)
par: Wang, Yueqian, et autres
Publié: (2025)
Multi-modal Stance Detection: New Datasets and Model
par: Liang, Bin, et autres
Publié: (2024)
par: Liang, Bin, et autres
Publié: (2024)
MM-Conv: A Multi-modal Conversational Dataset for Virtual Humans
par: Deichler, Anna, et autres
Publié: (2024)
par: Deichler, Anna, et autres
Publié: (2024)
An LLM Benchmark for Addressee Recognition in Multi-modal Multi-party Dialogue
par: Inoue, Koji, et autres
Publié: (2025)
par: Inoue, Koji, et autres
Publié: (2025)
MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning
par: Liu, Fuxiao, et autres
Publié: (2023)
par: Liu, Fuxiao, et autres
Publié: (2023)
Dynamic Graph Neural ODE Network for Multi-modal Emotion Recognition in Conversation
par: Shou, Yuntao, et autres
Publié: (2024)
par: Shou, Yuntao, et autres
Publié: (2024)
DetectiumFire: A Comprehensive Multi-modal Dataset Bridging Vision and Language for Fire Understanding
par: Liu, Zixuan, et autres
Publié: (2025)
par: Liu, Zixuan, et autres
Publié: (2025)
Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional
par: Madaan, Divyam, et autres
Publié: (2025)
par: Madaan, Divyam, et autres
Publié: (2025)
$M^3EL$: A Multi-task Multi-topic Dataset for Multi-modal Entity Linking
par: Wang, Fang, et autres
Publié: (2024)
par: Wang, Fang, et autres
Publié: (2024)
FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs
par: Yin, Zhihan, et autres
Publié: (2026)
par: Yin, Zhihan, et autres
Publié: (2026)
NaturalConv: A Chinese Dialogue Dataset Towards Multi-turn Topic-driven Conversation
par: Wang, Xiaoyang, et autres
Publié: (2021)
par: Wang, Xiaoyang, et autres
Publié: (2021)
Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines
par: Ma, Zi-Ao, et autres
Publié: (2024)
par: Ma, Zi-Ao, et autres
Publié: (2024)
Intent Recognition and Out-of-Scope Detection using LLMs in Multi-party Conversations
par: Castillo-López, Galo, et autres
Publié: (2025)
par: Castillo-López, Galo, et autres
Publié: (2025)
Chain-of-Discussion: A Multi-Model Framework for Complex Evidence-Based Question Answering
par: Tao, Mingxu, et autres
Publié: (2024)
par: Tao, Mingxu, et autres
Publié: (2024)
Contrastive Speaker-Aware Learning for Multi-party Dialogue Generation with LLMs
par: Sun, Tianyu, et autres
Publié: (2025)
par: Sun, Tianyu, et autres
Publié: (2025)
NYK-MS: A Well-annotated Multi-modal Metaphor and Sarcasm Understanding Benchmark on Cartoon-Caption Dataset
par: Chang, Ke, et autres
Publié: (2024)
par: Chang, Ke, et autres
Publié: (2024)
VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models
par: Wang, Yuxuan, et autres
Publié: (2024)
par: Wang, Yuxuan, et autres
Publié: (2024)
Akan Cinematic Emotions (ACE): A Multimodal Multi-party Dataset for Emotion Recognition in Movie Dialogues
par: Sasu, David, et autres
Publié: (2025)
par: Sasu, David, et autres
Publié: (2025)
Multi-party Response Generation with Relation Disentanglement
par: Dai, Tianhao, et autres
Publié: (2024)
par: Dai, Tianhao, et autres
Publié: (2024)
Multi-modal Semantic Understanding with Contrastive Cross-modal Feature Alignment
par: Zhang, Ming, et autres
Publié: (2024)
par: Zhang, Ming, et autres
Publié: (2024)
MAGID: An Automated Pipeline for Generating Synthetic Multi-modal Datasets
par: Aboutalebi, Hossein, et autres
Publié: (2024)
par: Aboutalebi, Hossein, et autres
Publié: (2024)
Mixture-of-Prompt-Experts for Multi-modal Semantic Understanding
par: Wu, Zichen, et autres
Publié: (2024)
par: Wu, Zichen, et autres
Publié: (2024)
CMMU: A Benchmark for Chinese Multi-modal Multi-type Question Understanding and Reasoning
par: He, Zheqi, et autres
Publié: (2024)
par: He, Zheqi, et autres
Publié: (2024)
Emphasis Rendering for Conversational Text-to-Speech with Multi-modal Multi-scale Context Modeling
par: Liu, Rui, et autres
Publié: (2024)
par: Liu, Rui, et autres
Publié: (2024)
Multi-Granularity Information Interaction Framework for Incomplete Utterance Rewriting
par: Du, Haowei, et autres
Publié: (2023)
par: Du, Haowei, et autres
Publié: (2023)
LingYi: Medical Conversational Question Answering System based on Multi-modal Knowledge Graphs
par: Xia, Fei, et autres
Publié: (2022)
par: Xia, Fei, et autres
Publié: (2022)
Teaching Text-to-Image Models to Communicate in Dialog
par: Sun, Xiaowen, et autres
Publié: (2023)
par: Sun, Xiaowen, et autres
Publié: (2023)
Multi-domain Multi-modal Document Classification Benchmark with a Multi-level Taxonomy
par: Ma, Denghao, et autres
Publié: (2026)
par: Ma, Denghao, et autres
Publié: (2026)
Resource-Friendly Dynamic Enhancement Chain for Multi-Hop Question Answering
par: Ji, Binquan, et autres
Publié: (2025)
par: Ji, Binquan, et autres
Publié: (2025)
Documents similaires
-
HawkEye: Training Video-Text LLMs for Grounding Text in Videos
par: Wang, Yueqian, et autres
Publié: (2024) -
End-to-End Video Question Answering with Frame Scoring Mechanisms and Adaptive Sampling
par: Liang, Jianxin, et autres
Publié: (2024) -
VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format
par: Wang, Yueqian, et autres
Publié: (2024) -
ReasVQA: Advancing VideoQA with Imperfect Reasoning Process
par: Liang, Jianxin, et autres
Publié: (2025) -
Efficient Temporal Extrapolation of Multimodal Large Language Models with Temporal Grounding Bridge
par: Wang, Yuxuan, et autres
Publié: (2024)