OmniTrace: A Unified Framework for Generation-Time Attribution in Omni-Modal LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Yan, Qianqi, Guo, Yichen, Kuo, Ching-Chen, Jiang, Shan, Yin, Hang, Zhao, Yang, Wang, Xin Eric |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
par: Chen, Qian, et autres
Publié: (2026)
par: Chen, Qian, et autres
Publié: (2026)
ChronusOmni: Improving Time Awareness of Omni Large Language Models
par: Chen, Yijing, et autres
Publié: (2025)
par: Chen, Yijing, et autres
Publié: (2025)
OmniGAIA: Towards Native Omni-Modal AI Agents
par: Li, Xiaoxi, et autres
Publié: (2026)
par: Li, Xiaoxi, et autres
Publié: (2026)
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
par: Chen, Junzhe, et autres
Publié: (2025)
par: Chen, Junzhe, et autres
Publié: (2025)
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
par: Wang, Chengyao, et autres
Publié: (2025)
par: Wang, Chengyao, et autres
Publié: (2025)
OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities
par: Chen, Lichang, et autres
Publié: (2024)
par: Chen, Lichang, et autres
Publié: (2024)
OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup
par: Cheng, Xize, et autres
Publié: (2024)
par: Cheng, Xize, et autres
Publié: (2024)
Omni-Captioner: Data Pipeline, Models, and Benchmark for Omni Detailed Perception
par: Ma, Ziyang, et autres
Publié: (2025)
par: Ma, Ziyang, et autres
Publié: (2025)
AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction
par: Chen, Zixuan, et autres
Publié: (2026)
par: Chen, Zixuan, et autres
Publié: (2026)
LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos
par: Geng, Tiantian, et autres
Publié: (2024)
par: Geng, Tiantian, et autres
Publié: (2024)
Ola: Pushing the Frontiers of Omni-Modal Language Model
par: Liu, Zuyan, et autres
Publié: (2025)
par: Liu, Zuyan, et autres
Publié: (2025)
OmniEvalKit: A Modular, Lightweight Toolbox for Evaluating Large Language Model and its Omni-Extensions
par: Zhang, Yi-Kai, et autres
Publié: (2024)
par: Zhang, Yi-Kai, et autres
Publié: (2024)
Omni2Sound: Towards Unified Video-Text-to-Audio Generation
par: Dai, Yusheng, et autres
Publié: (2026)
par: Dai, Yusheng, et autres
Publié: (2026)
Omni-C: Compressing Heterogeneous Modalities into a Single Dense Encoder
par: Lau, Kin Wai, et autres
Publié: (2026)
par: Lau, Kin Wai, et autres
Publié: (2026)
LongCat-Flash-Omni Technical Report
par: Meituan LongCat Team, et autres
Publié: (2025)
par: Meituan LongCat Team, et autres
Publié: (2025)
Lyra: An Efficient and Speech-Centric Framework for Omni-Cognition
par: Zhong, Zhisheng, et autres
Publié: (2024)
par: Zhong, Zhisheng, et autres
Publié: (2024)
MMAPS: End-to-End Multi-Grained Multi-Modal Attribute-Aware Product Summarization
par: Chen, Tao, et autres
Publié: (2023)
par: Chen, Tao, et autres
Publié: (2023)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
par: Pu, Junfu, et autres
Publié: (2026)
par: Pu, Junfu, et autres
Publié: (2026)
Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation
par: Chen, Yuheng, et autres
Publié: (2026)
par: Chen, Yuheng, et autres
Publié: (2026)
UMETTS: A Unified Framework for Emotional Text-to-Speech Synthesis with Multimodal Prompts
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
par: Cheng, Zhi-Qi, et autres
Publié: (2024)
VALOR: Vision-Audio-Language Omni-Perception Pretraining Model and Dataset
par: Liu, Jing, et autres
Publié: (2023)
par: Liu, Jing, et autres
Publié: (2023)
OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows
par: Li, Shufan, et autres
Publié: (2024)
par: Li, Shufan, et autres
Publié: (2024)
M$^3$Face: A Unified Multi-Modal Multilingual Framework for Human Face Generation and Editing
par: Mofayezi, Mohammadreza, et autres
Publié: (2024)
par: Mofayezi, Mohammadreza, et autres
Publié: (2024)
Towards Unified Multi-Modal Personalization: Large Vision-Language Models for Generative Recommendation and Beyond
par: Wei, Tianxin, et autres
Publié: (2024)
par: Wei, Tianxin, et autres
Publié: (2024)
ChartEditor: A Reinforcement Learning Framework for Robust Chart Editing
par: Chen, Liangyu, et autres
Publié: (2025)
par: Chen, Liangyu, et autres
Publié: (2025)
OralGPT-Omni: A Versatile Dental Multimodal Large Language Model
par: Hao, Jing, et autres
Publié: (2025)
par: Hao, Jing, et autres
Publié: (2025)
SemCORE: A Semantic-Enhanced Generative Cross-Modal Retrieval Framework with MLLMs
par: Li, Haoxuan, et autres
Publié: (2025)
par: Li, Haoxuan, et autres
Publié: (2025)
LongInsightBench: A Comprehensive Benchmark for Evaluating Omni-Modal Models on Human-Centric Long-Video Understanding
par: Han, ZhaoYang, et autres
Publié: (2025)
par: Han, ZhaoYang, et autres
Publié: (2025)
OmniSonic: Towards Universal and Holistic Audio Generation from Video and Text
par: Pian, Weiguo, et autres
Publié: (2026)
par: Pian, Weiguo, et autres
Publié: (2026)
Audio-Omni: Extending Multi-modal Understanding to Versatile Audio Generation and Editing
par: Tian, Zeyue, et autres
Publié: (2026)
par: Tian, Zeyue, et autres
Publié: (2026)
MolCA: Molecular Graph-Language Modeling with Cross-Modal Projector and Uni-Modal Adapter
par: Liu, Zhiyuan, et autres
Publié: (2023)
par: Liu, Zhiyuan, et autres
Publié: (2023)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
par: Liu, Che, et autres
Publié: (2026)
par: Liu, Che, et autres
Publié: (2026)
V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation
par: Chan, Nolan, et autres
Publié: (2026)
par: Chan, Nolan, et autres
Publié: (2026)
OmniForcing: Unleashing Real-time Joint Audio-Visual Generation
par: Su, Yaofeng, et autres
Publié: (2026)
par: Su, Yaofeng, et autres
Publié: (2026)
OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model
par: Li, Maomao, et autres
Publié: (2026)
par: Li, Maomao, et autres
Publié: (2026)
Less for More: Enhanced Feedback-aligned Mixed LLMs for Molecule Caption Generation and Fine-Grained NLI Evaluation
par: Gkoumas, Dimitris, et autres
Publié: (2024)
par: Gkoumas, Dimitris, et autres
Publié: (2024)
Knowledge-Guided Dynamic Modality Attention Fusion Framework for Multimodal Sentiment Analysis
par: Feng, Xinyu, et autres
Publié: (2024)
par: Feng, Xinyu, et autres
Publié: (2024)
OmniMER: Auxiliary-Enhanced LLM Adaptation for Indonesian Multimodal Emotion Recognition
par: Yan, Xueming, et autres
Publié: (2025)
par: Yan, Xueming, et autres
Publié: (2025)
AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues
par: Zhou, Dingkun, et autres
Publié: (2025)
par: Zhou, Dingkun, et autres
Publié: (2025)
Co-Reinforcement Learning for Unified Multimodal Understanding and Generation
par: Jiang, Jingjing, et autres
Publié: (2025)
par: Jiang, Jingjing, et autres
Publié: (2025)
Documents similaires
-
FutureOmni: Evaluating Future Forecasting from Omni-Modal Context for Multimodal LLMs
par: Chen, Qian, et autres
Publié: (2026) -
ChronusOmni: Improving Time Awareness of Omni Large Language Models
par: Chen, Yijing, et autres
Publié: (2025) -
OmniGAIA: Towards Native Omni-Modal AI Agents
par: Li, Xiaoxi, et autres
Publié: (2026) -
OmniDPO: A Preference Optimization Framework to Address Omni-Modal Hallucination
par: Chen, Junzhe, et autres
Publié: (2025) -
MGM-Omni: Scaling Omni LLMs to Personalized Long-Horizon Speech
par: Wang, Chengyao, et autres
Publié: (2025)