HumanOmni-Speaker: Identifying Who said What and When
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Bai, Detao, Yao, Shimin, Chen, Weixuan, Ma, Zhiheng, Wei, Xihan, Zhou, Jingren |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
par: Zhao, Jiaxing, et autres
Publié: (2025)
par: Zhao, Jiaxing, et autres
Publié: (2025)
OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder
par: Bai, Detao, et autres
Publié: (2026)
par: Bai, Detao, et autres
Publié: (2026)
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
par: Yang, Qize, et autres
Publié: (2025)
par: Yang, Qize, et autres
Publié: (2025)
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
par: Yang, Qize, et autres
Publié: (2025)
par: Yang, Qize, et autres
Publié: (2025)
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
par: Bai, Detao, et autres
Publié: (2025)
par: Bai, Detao, et autres
Publié: (2025)
R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning
par: Zhao, Jiaxing, et autres
Publié: (2025)
par: Zhao, Jiaxing, et autres
Publié: (2025)
OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework
par: Zeng, Weixuan, et autres
Publié: (2026)
par: Zeng, Weixuan, et autres
Publié: (2026)
Omni-SILA: Towards Omni-scene Driven Visual Sentiment Identifying, Locating and Attributing in Videos
par: Luo, Jiamin, et autres
Publié: (2025)
par: Luo, Jiamin, et autres
Publié: (2025)
Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction
par: He, Chaoqun, et autres
Publié: (2026)
par: He, Chaoqun, et autres
Publié: (2026)
OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation
par: Zhu, Lei, et autres
Publié: (2026)
par: Zhu, Lei, et autres
Publié: (2026)
When Segmentation Meets Hyperspectral Image: New Paradigm for Hyperspectral Image Classification
par: Zhou, Weilian, et autres
Publié: (2025)
par: Zhou, Weilian, et autres
Publié: (2025)
FLAME: Frozen Large Language Models Enable Data-Efficient Language-Image Pre-training
par: Cao, Anjia, et autres
Publié: (2024)
par: Cao, Anjia, et autres
Publié: (2024)
OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation
par: Zhou, Donghao, et autres
Publié: (2026)
par: Zhou, Donghao, et autres
Publié: (2026)
OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026
par: Li, Zixu, et autres
Publié: (2026)
par: Li, Zixu, et autres
Publié: (2026)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
par: Yao, Jiali, et autres
Publié: (2025)
par: Yao, Jiali, et autres
Publié: (2025)
ThinkOmni: Lifting Textual Reasoning to Omni-modal Scenarios via Guidance Decoding
par: Guan, Yiran, et autres
Publié: (2026)
par: Guan, Yiran, et autres
Publié: (2026)
Unsupervised Domain Adaption Harnessing Vision-Language Pre-training
par: Zhou, Wenlve, et autres
Publié: (2024)
par: Zhou, Wenlve, et autres
Publié: (2024)
OmniAD: Detect and Understand Industrial Anomaly via Multimodal Reasoning
par: Zhao, Shifang, et autres
Publié: (2025)
par: Zhao, Shifang, et autres
Publié: (2025)
OmniRe: Omni Urban Scene Reconstruction
par: Chen, Ziyu, et autres
Publié: (2024)
par: Chen, Ziyu, et autres
Publié: (2024)
OmniPerson: Unified Identity-Preserving Pedestrian Generation
par: Ma, Changxiao, et autres
Publié: (2025)
par: Ma, Changxiao, et autres
Publié: (2025)
OmniGaze: Reward-inspired Generalizable Gaze Estimation In The Wild
par: Qu, Hongyu, et autres
Publié: (2025)
par: Qu, Hongyu, et autres
Publié: (2025)
Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?
par: Liang, Susan, et autres
Publié: (2026)
par: Liang, Susan, et autres
Publié: (2026)
Grid: Omni Visual Generation
par: Wan, Cong, et autres
Publié: (2024)
par: Wan, Cong, et autres
Publié: (2024)
RemoteZero: Geospatial Reasoning with Zero Human Annotations
par: Yao, Liang, et autres
Publié: (2026)
par: Yao, Liang, et autres
Publié: (2026)
OmniAlign-V: Towards Enhanced Alignment of MLLMs with Human Preference
par: Zhao, Xiangyu, et autres
Publié: (2025)
par: Zhao, Xiangyu, et autres
Publié: (2025)
Omni$^2$: Unifying Omnidirectional Image Generation and Editing in an Omni Model
par: Yang, Liu, et autres
Publié: (2025)
par: Yang, Liu, et autres
Publié: (2025)
OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens
par: Yang, Yiying, et autres
Publié: (2026)
par: Yang, Yiying, et autres
Publié: (2026)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
par: Tong, Wenwen, et autres
Publié: (2025)
par: Tong, Wenwen, et autres
Publié: (2025)
OmniHD-Scenes: A Next-Generation Multimodal Dataset for Autonomous Driving
par: Zheng, Lianqing, et autres
Publié: (2024)
par: Zheng, Lianqing, et autres
Publié: (2024)
OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces
par: Wang, Zehan, et autres
Publié: (2024)
par: Wang, Zehan, et autres
Publié: (2024)
OmniInsert: Mask-Free Video Insertion of Any Reference via Diffusion Transformer Models
par: Chen, Jinshu, et autres
Publié: (2025)
par: Chen, Jinshu, et autres
Publié: (2025)
HOMIE: Histopathology Omni-modal Embedding for Pathology Composed Retrieval
par: Zhou, Qifeng, et autres
Publié: (2025)
par: Zhou, Qifeng, et autres
Publié: (2025)
SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers
par: Fei, Zhengcong, et autres
Publié: (2025)
par: Fei, Zhengcong, et autres
Publié: (2025)
DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation
par: Guo, Xu, et autres
Publié: (2026)
par: Guo, Xu, et autres
Publié: (2026)
OmniParser: A Unified Framework for Text Spotting, Key Information Extraction and Table Recognition
par: Wan, Jianqiang, et autres
Publié: (2024)
par: Wan, Jianqiang, et autres
Publié: (2024)
OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models
par: Lin, Gaojie, et autres
Publié: (2025)
par: Lin, Gaojie, et autres
Publié: (2025)
Omni-Referring Image Segmentation
par: Zheng, Qiancheng, et autres
Publié: (2025)
par: Zheng, Qiancheng, et autres
Publié: (2025)
Technical Report for ActivityNet Challenge 2022 -- Temporal Action Localization
par: Chen, Shimin, et autres
Publié: (2024)
par: Chen, Shimin, et autres
Publié: (2024)
Evolving Token Communication with Parametric Memory Network
par: Chen, Weixuan, et autres
Publié: (2026)
par: Chen, Weixuan, et autres
Publié: (2026)
OmniSVG: A Unified Scalable Vector Graphics Generation Model
par: Yang, Yiying, et autres
Publié: (2025)
par: Yang, Yiying, et autres
Publié: (2025)
Documents similaires
-
HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding
par: Zhao, Jiaxing, et autres
Publié: (2025) -
OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder
par: Bai, Detao, et autres
Publié: (2026) -
HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context
par: Yang, Qize, et autres
Publié: (2025) -
Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis
par: Yang, Qize, et autres
Publié: (2025) -
CoGenAV: Versatile Audio-Visual Representation Learning via Contrastive-Generative Synchronization
par: Bai, Detao, et autres
Publié: (2025)