Towards Event Extraction from Speech with Contextual Clues
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Kang, Jingqi, Wu, Tongtong, Zhao, Jinming, Wang, Guitao, Qi, Guilin, Li, Yuan-Fang, Haffari, Gholamreza |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Double Mixture: Towards Continual Event Detection from Speech
par: Kang, Jingqi, et autres
Publié: (2024)
par: Kang, Jingqi, et autres
Publié: (2024)
Continual Speech Learning with Fused Speech Features
par: Wang, Guitao, et autres
Publié: (2025)
par: Wang, Guitao, et autres
Publié: (2025)
Resurfacing Paralinguistic Awareness in Large Audio Language Models
par: Yang, Hao, et autres
Publié: (2026)
par: Yang, Hao, et autres
Publié: (2026)
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
par: Yang, Hao, et autres
Publié: (2024)
par: Yang, Hao, et autres
Publié: (2024)
Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models
par: Yang, Hao, et autres
Publié: (2025)
par: Yang, Hao, et autres
Publié: (2025)
Benchmarking and Improving LVLMs on Event Extraction from Multimedia Documents
par: Xing, Fuyu, et autres
Publié: (2025)
par: Xing, Fuyu, et autres
Publié: (2025)
SpeechCraft: A Fine-grained Expressive Speech Dataset with Natural Language Description
par: Jin, Zeyu, et autres
Publié: (2024)
par: Jin, Zeyu, et autres
Publié: (2024)
ELEGANCE: Efficient LLM Guidance for Audio-Visual Target Speech Extraction
par: Wu, Wenxuan, et autres
Publié: (2025)
par: Wu, Wenxuan, et autres
Publié: (2025)
Towards Event-oriented Long Video Understanding
par: Du, Yifan, et autres
Publié: (2024)
par: Du, Yifan, et autres
Publié: (2024)
SpeechEE: A Novel Benchmark for Speech Event Extraction
par: Wang, Bin, et autres
Publié: (2024)
par: Wang, Bin, et autres
Publié: (2024)
HeGTa: Leveraging Heterogeneous Graph-enhanced Large Language Models for Few-shot Complex Table Understanding
par: Jin, Rihui, et autres
Publié: (2024)
par: Jin, Rihui, et autres
Publié: (2024)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
Dependency Structure Augmented Contextual Scoping Framework for Multimodal Aspect-Based Sentiment Analysis
par: Liu, Hao, et autres
Publié: (2025)
par: Liu, Hao, et autres
Publié: (2025)
TARQ: Tail-Aware Reconstruction Quantization for Rare-Word Robust Automatic Speech Recognition
par: Wang, Xinyu, et autres
Publié: (2026)
par: Wang, Xinyu, et autres
Publié: (2026)
Enhancing Multimodal Entity and Relation Extraction with Variational Information Bottleneck
par: Cui, Shiyao, et autres
Publié: (2023)
par: Cui, Shiyao, et autres
Publié: (2023)
CARD: Towards Conditional Design of Multi-agent Topological Structures
par: Wu, Tongtong, et autres
Publié: (2026)
par: Wu, Tongtong, et autres
Publié: (2026)
ResearchPulse: Building Method-Experiment Chains through Multi-Document Scientific Inference
par: Chen, Qi, et autres
Publié: (2025)
par: Chen, Qi, et autres
Publié: (2025)
Mixture-of-Prompt-Experts for Multi-modal Semantic Understanding
par: Wu, Zichen, et autres
Publié: (2024)
par: Wu, Zichen, et autres
Publié: (2024)
LaF-GRPO: In-Situ Navigation Instruction Generation for the Visually Impaired via GRPO with LLM-as-Follower Reward
par: Zhao, Yi, et autres
Publié: (2025)
par: Zhao, Yi, et autres
Publié: (2025)
A Simple Method to Enhance Pre-trained Language Models with Speech Tokens for Classification
par: Calbucura, Nicolas, et autres
Publié: (2025)
par: Calbucura, Nicolas, et autres
Publié: (2025)
Speech as a Multimodal Digital Phenotype for Multi-Task LLM-based Mental Health Prediction
par: Ali, Mai, et autres
Publié: (2025)
par: Ali, Mai, et autres
Publié: (2025)
ReactXT: Understanding Molecular "Reaction-ship" via Reaction-Contextualized Molecule-Text Pretraining
par: Liu, Zhiyuan, et autres
Publié: (2024)
par: Liu, Zhiyuan, et autres
Publié: (2024)
Modeling Layout Reading Order as Ordering Relations for Visually-rich Document Understanding
par: Zhang, Chong, et autres
Publié: (2024)
par: Zhang, Chong, et autres
Publié: (2024)
TeleAntiFraud-28k: An Audio-Text Slow-Thinking Dataset for Telecom Fraud Detection
par: Ma, Zhiming, et autres
Publié: (2025)
par: Ma, Zhiming, et autres
Publié: (2025)
Shapley Value-based Contrastive Alignment for Multimodal Information Extraction
par: Luo, Wen, et autres
Publié: (2024)
par: Luo, Wen, et autres
Publié: (2024)
SLAM-LLM: A Modular, Open-Source Multimodal Large Language Model Framework and Best Practice for Speech, Language, Audio and Music Processing
par: Ma, Ziyang, et autres
Publié: (2026)
par: Ma, Ziyang, et autres
Publié: (2026)
CommonVoice-SpeechRE and RPG-MoGe: Advancing Speech Relation Extraction with a New Dataset and Multi-Order Generative Framework
par: Ning, Jinzhong, et autres
Publié: (2025)
par: Ning, Jinzhong, et autres
Publié: (2025)
Remember Past, Anticipate Future: Learning Continual Multimodal Misinformation Detectors
par: Wang, Bing, et autres
Publié: (2025)
par: Wang, Bing, et autres
Publié: (2025)
Multi-MLLM Knowledge Distillation for Out-of-Context News Detection
par: Gu, Yimeng, et autres
Publié: (2025)
par: Gu, Yimeng, et autres
Publié: (2025)
Towards Better Text-to-Image Generation Alignment via Attention Modulation
par: Wu, Yihang, et autres
Publié: (2024)
par: Wu, Yihang, et autres
Publié: (2024)
Decompose, Enrich, and Extract! Schema-aware Event Extraction using LLMs
par: Shiri, Fatemeh, et autres
Publié: (2024)
par: Shiri, Fatemeh, et autres
Publié: (2024)
LLaVA-NeuMT: Selective Layer-Neuron Modulation for Efficient Multilingual Multimodal Translation
par: Wei, Jingxuan, et autres
Publié: (2025)
par: Wei, Jingxuan, et autres
Publié: (2025)
RealBench: A Chinese Multi-image Understanding Benchmark Close to Real-world Scenarios
par: Zhao, Fei, et autres
Publié: (2025)
par: Zhao, Fei, et autres
Publié: (2025)
Towards Pretraining Robust ASR Foundation Model with Acoustic-Aware Data Augmentation
par: Liu, Dancheng, et autres
Publié: (2025)
par: Liu, Dancheng, et autres
Publié: (2025)
ChemDFM-X: Towards Large Multimodal Model for Chemistry
par: Zhao, Zihan, et autres
Publié: (2024)
par: Zhao, Zihan, et autres
Publié: (2024)
Towards Expressive Video Dubbing with Multiscale Multimodal Context Interaction
par: Zhao, Yuan, et autres
Publié: (2024)
par: Zhao, Yuan, et autres
Publié: (2024)
MIntRec2.0: A Large-scale Benchmark Dataset for Multimodal Intent Recognition and Out-of-scope Detection in Conversations
par: Zhang, Hanlei, et autres
Publié: (2024)
par: Zhang, Hanlei, et autres
Publié: (2024)
mPLUG-PaperOwl: Scientific Diagram Analysis with the Multimodal Large Language Model
par: Hu, Anwen, et autres
Publié: (2023)
par: Hu, Anwen, et autres
Publié: (2023)
TCAN: Text-oriented Cross Attention Network for Multimodal Sentiment Analysis
par: Quan, Weize, et autres
Publié: (2024)
par: Quan, Weize, et autres
Publié: (2024)
Documents similaires
-
Double Mixture: Towards Continual Event Detection from Speech
par: Kang, Jingqi, et autres
Publié: (2024) -
Continual Speech Learning with Fused Speech Features
par: Wang, Guitao, et autres
Publié: (2025) -
Resurfacing Paralinguistic Awareness in Large Audio Language Models
par: Yang, Hao, et autres
Publié: (2026) -
Audio Is the Achilles' Heel: Red Teaming Audio Large Multimodal Models
par: Yang, Hao, et autres
Publié: (2024) -
Reshaping Representation Space to Balance the Safety and Over-rejection in Large Audio Language Models
par: Yang, Hao, et autres
Publié: (2025)