LLM-AD: Large Language Model based Audio Description System
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Chu, Peng, Wang, Jiang, Abrantes, Andre |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
DistinctAD: Distinctive Audio Description Generation in Contexts
par: Fang, Bo, et autres
Publié: (2024)
par: Fang, Bo, et autres
Publié: (2024)
FocusedAD: Character-centric Movie Audio Description
par: Ye, Xiaojun, et autres
Publié: (2025)
par: Ye, Xiaojun, et autres
Publié: (2025)
DANTE-AD: Dual-Vision Attention Network for Long-Term Audio Description
par: Deganutti, Adrienne, et autres
Publié: (2025)
par: Deganutti, Adrienne, et autres
Publié: (2025)
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
par: Xie, Junyu, et autres
Publié: (2024)
par: Xie, Junyu, et autres
Publié: (2024)
Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models
par: Wang, Xiaomeng, et autres
Publié: (2026)
par: Wang, Xiaomeng, et autres
Publié: (2026)
Exploring the Distinctiveness and Fidelity of the Descriptions Generated by Large Vision-Language Models
par: Huang, Yuhang, et autres
Publié: (2024)
par: Huang, Yuhang, et autres
Publié: (2024)
Boosting Audio-visual Zero-shot Learning with Large Language Models
par: Chen, Haoxing, et autres
Publié: (2023)
par: Chen, Haoxing, et autres
Publié: (2023)
video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models
par: Sun, Guangzhi, et autres
Publié: (2024)
par: Sun, Guangzhi, et autres
Publié: (2024)
AudioStory: Generating Long-Form Narrative Audio with Large Language Models
par: Guo, Yuxin, et autres
Publié: (2025)
par: Guo, Yuxin, et autres
Publié: (2025)
OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models
par: Tao, Keda, et autres
Publié: (2025)
par: Tao, Keda, et autres
Publié: (2025)
dVLM-AD: Enhance Diffusion Vision-Language-Model for Driving via Controllable Reasoning
par: Ma, Yingzi, et autres
Publié: (2025)
par: Ma, Yingzi, et autres
Publié: (2025)
SwissADT: An Audio Description Translation System for Swiss Languages
par: Fischer, Lukas, et autres
Publié: (2024)
par: Fischer, Lukas, et autres
Publié: (2024)
LLM-YOLOMS: Large Language Model-based Semantic Interpretation and Fault Diagnosis for Wind Turbine Components
par: Li, Yaru, et autres
Publié: (2025)
par: Li, Yaru, et autres
Publié: (2025)
Audio-Visual Intelligence in Large Foundation Models
par: Qin, You, et autres
Publié: (2026)
par: Qin, You, et autres
Publié: (2026)
EvdCLIP: Improving Vision-Language Retrieval with Entity Visual Descriptions from Large Language Models
par: Meng, GuangHao, et autres
Publié: (2025)
par: Meng, GuangHao, et autres
Publié: (2025)
NowYouSee Me: Context-Aware Automatic Audio Description
par: Lee, Seon-Ho, et autres
Publié: (2024)
par: Lee, Seon-Ho, et autres
Publié: (2024)
SignLLM: Sign Language Production Large Language Models
par: Fang, Sen, et autres
Publié: (2024)
par: Fang, Sen, et autres
Publié: (2024)
Empowering Segmentation Ability to Multi-modal Large Language Models
par: Yang, Yuqi, et autres
Publié: (2024)
par: Yang, Yuqi, et autres
Publié: (2024)
AVHBench: A Cross-Modal Hallucination Benchmark for Audio-Visual Large Language Models
par: Sung-Bin, Kim, et autres
Publié: (2024)
par: Sung-Bin, Kim, et autres
Publié: (2024)
AVCD: Mitigating Hallucinations in Audio-Visual Large Language Models through Contrastive Decoding
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
video-SALMONN-o1: Reasoning-enhanced Audio-visual Large Language Model
par: Sun, Guangzhi, et autres
Publié: (2025)
par: Sun, Guangzhi, et autres
Publié: (2025)
Fork-Merge Decoding: Enhancing Multimodal Understanding in Audio-Visual Large Language Models
par: Jung, Chaeyoung, et autres
Publié: (2025)
par: Jung, Chaeyoung, et autres
Publié: (2025)
Descrip3D: Enhancing Large Language Model-based 3D Scene Understanding with Object-Level Text Descriptions
par: Xue, Jintang, et autres
Publié: (2025)
par: Xue, Jintang, et autres
Publié: (2025)
AD-H: Language-guided Autonomous Driving with Hierarchical Agents
par: Zhang, Zaibin, et autres
Publié: (2024)
par: Zhang, Zaibin, et autres
Publié: (2024)
MEDIC-AD: Towards Medical Vision-Language Model's Clinical Intelligence
par: Park, Woohyeon, et autres
Publié: (2026)
par: Park, Woohyeon, et autres
Publié: (2026)
Unified Scene Representation and Reconstruction for 3D Large Language Models
par: Chu, Tao, et autres
Publié: (2024)
par: Chu, Tao, et autres
Publié: (2024)
KptLLM: Unveiling the Power of Large Language Model for Keypoint Comprehension
par: Yang, Jie, et autres
Publié: (2024)
par: Yang, Jie, et autres
Publié: (2024)
Period-LLM: Extending the Periodic Capability of Multimodal Large Language Model
par: Zhang, Yuting, et autres
Publié: (2025)
par: Zhang, Yuting, et autres
Publié: (2025)
Investigating and Enhancing Vision-Audio Capability in Omnimodal Large Language Models
par: Hu, Rui, et autres
Publié: (2025)
par: Hu, Rui, et autres
Publié: (2025)
KptLLM++: Towards Generic Keypoint Comprehension with Large Language Model
par: Yang, Jie, et autres
Publié: (2025)
par: Yang, Jie, et autres
Publié: (2025)
The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio
par: Leng, Sicong, et autres
Publié: (2024)
par: Leng, Sicong, et autres
Publié: (2024)
CAT: Enhancing Multimodal Large Language Model to Answer Questions in Dynamic Audio-Visual Scenarios
par: Ye, Qilang, et autres
Publié: (2024)
par: Ye, Qilang, et autres
Publié: (2024)
LLM4VG: Large Language Models Evaluation for Video Grounding
par: Feng, Wei, et autres
Publié: (2023)
par: Feng, Wei, et autres
Publié: (2023)
Survey of Adversarial Robustness in Multimodal Large Language Models
par: Jiang, Chengze, et autres
Publié: (2025)
par: Jiang, Chengze, et autres
Publié: (2025)
LLMGA: Multimodal Large Language Model based Generation Assistant
par: Xia, Bin, et autres
Publié: (2023)
par: Xia, Bin, et autres
Publié: (2023)
Next Token Is Enough: Realistic Image Quality and Aesthetic Scoring with Multimodal Large Language Model
par: Li, Mingxing, et autres
Publié: (2025)
par: Li, Mingxing, et autres
Publié: (2025)
CLIP-AD: A Language-Guided Staged Dual-Path Model for Zero-shot Anomaly Detection
par: Chen, Xuhai, et autres
Publié: (2023)
par: Chen, Xuhai, et autres
Publié: (2023)
Pro-AD: Learning Comprehensive Prototypes with Prototype-based Constraint for Multi-class Unsupervised Anomaly Detection
par: Zhou, Ziqing, et autres
Publié: (2025)
par: Zhou, Ziqing, et autres
Publié: (2025)
LocLLM: Exploiting Generalizable Human Keypoint Localization via Large Language Model
par: Wang, Dongkai, et autres
Publié: (2024)
par: Wang, Dongkai, et autres
Publié: (2024)
ST-LLM: Large Language Models Are Effective Temporal Learners
par: Liu, Ruyang, et autres
Publié: (2024)
par: Liu, Ruyang, et autres
Publié: (2024)
Documents similaires
-
DistinctAD: Distinctive Audio Description Generation in Contexts
par: Fang, Bo, et autres
Publié: (2024) -
FocusedAD: Character-centric Movie Audio Description
par: Ye, Xiaojun, et autres
Publié: (2025) -
DANTE-AD: Dual-Vision Attention Network for Long-Term Audio Description
par: Deganutti, Adrienne, et autres
Publié: (2025) -
AutoAD-Zero: A Training-Free Framework for Zero-Shot Audio Description
par: Xie, Junyu, et autres
Publié: (2024) -
Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models
par: Wang, Xiaomeng, et autres
Publié: (2026)