Omni-SILA: Towards Omni-scene Driven Visual Sentiment Identifying, Locating and Attributing in Videos
Fuente:
arXiv
Guardado en:
| Autores principales: | Luo, Jiamin, Wang, Jingjing, Ma, Junxiao, Jin, Yujie, Li, Shoushan, Zhou, Guodong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Sherlock: Towards Multi-scene Video Abnormal Event Extraction and Localization via a Global-local Spatial-sensitive LLM
por: Ma, Junxiao, et al.
Publicado: (2025)
por: Ma, Junxiao, et al.
Publicado: (2025)
DeepSVU: Towards In-depth Security-oriented Video Understanding via Unified Physical-world Regularized MoE
por: Jin, Yujie, et al.
Publicado: (2026)
por: Jin, Yujie, et al.
Publicado: (2026)
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
por: Zhang, Yiman, et al.
Publicado: (2025)
por: Zhang, Yiman, et al.
Publicado: (2025)
OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
por: Zhang, Guohui, et al.
Publicado: (2026)
por: Zhang, Guohui, et al.
Publicado: (2026)
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
por: Peng, Haosong, et al.
Publicado: (2025)
por: Peng, Haosong, et al.
Publicado: (2025)
UGC-VideoCaptioner: An Omni UGC Video Detail Caption Model and New Benchmarks
por: Wu, Peiran, et al.
Publicado: (2025)
por: Wu, Peiran, et al.
Publicado: (2025)
OmniBench: Towards The Future of Universal Omni-Language Models
por: Li, Yizhi, et al.
Publicado: (2024)
por: Li, Yizhi, et al.
Publicado: (2024)
Omni-Reward: Towards Generalist Omni-Modal Reward Modeling with Free-Form Preferences
por: Jin, Zhuoran, et al.
Publicado: (2025)
por: Jin, Zhuoran, et al.
Publicado: (2025)
OmniGAIA: Towards Native Omni-Modal AI Agents
por: Li, Xiaoxi, et al.
Publicado: (2026)
por: Li, Xiaoxi, et al.
Publicado: (2026)
OmniSTVG: Toward Spatio-Temporal Omni-Object Video Grounding
por: Yao, Jiali, et al.
Publicado: (2025)
por: Yao, Jiali, et al.
Publicado: (2025)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
por: Liu, Yunze, et al.
Publicado: (2026)
por: Liu, Yunze, et al.
Publicado: (2026)
Comment-aided Video-Language Alignment via Contrastive Pre-training for Short-form Video Humor Detection
por: Liu, Yang, et al.
Publicado: (2024)
por: Liu, Yang, et al.
Publicado: (2024)
Omni-Attribute: Open-vocabulary Attribute Encoder for Visual Concept Personalization
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
por: Chen, Tsai-Shien, et al.
Publicado: (2025)
OmniDiT: Extending Diffusion Transformer to Omni-VTON Framework
por: Zeng, Weixuan, et al.
Publicado: (2026)
por: Zeng, Weixuan, et al.
Publicado: (2026)
Daily-Omni: Towards Audio-Visual Reasoning with Temporal Alignment across Modalities
por: Zhou, Ziwei, et al.
Publicado: (2025)
por: Zhou, Ziwei, et al.
Publicado: (2025)
ViT-Lens: Towards Omni-modal Representations
por: Lei, Weixian, et al.
Publicado: (2023)
por: Lei, Weixian, et al.
Publicado: (2023)
Grid: Omni Visual Generation
por: Wan, Cong, et al.
Publicado: (2024)
por: Wan, Cong, et al.
Publicado: (2024)
O-MARC: Omni Memory-Augmented Compression Distillation for Efficient Video Understanding
por: Wu, Peiran, et al.
Publicado: (2026)
por: Wu, Peiran, et al.
Publicado: (2026)
OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation
por: Gan, Qijun, et al.
Publicado: (2025)
por: Gan, Qijun, et al.
Publicado: (2025)
Omni IIE Bench: Benchmarking the Practical Capabilities of Image Editing Models
por: Yang, Yujia, et al.
Publicado: (2026)
por: Yang, Yujia, et al.
Publicado: (2026)
Omni-Effects: Unified and Spatially-Controllable Visual Effects Generation
por: Mao, Fangyuan, et al.
Publicado: (2025)
por: Mao, Fangyuan, et al.
Publicado: (2025)
OmniPrism: Learning Disentangled Visual Concept for Image Generation
por: Li, Yangyang, et al.
Publicado: (2024)
por: Li, Yangyang, et al.
Publicado: (2024)
OmniGen2: Towards Instruction-Aligned Multimodal Generation
por: Wu, Chenyuan, et al.
Publicado: (2025)
por: Wu, Chenyuan, et al.
Publicado: (2025)
OmniVDiff: Omni Controllable Video Diffusion for Generation and Understanding
por: Xi, Dianbing, et al.
Publicado: (2025)
por: Xi, Dianbing, et al.
Publicado: (2025)
DreamVideo-Omni: Omni-Motion Controlled Multi-Subject Video Customization with Latent Identity Reinforcement Learning
por: Wei, Yujie, et al.
Publicado: (2026)
por: Wei, Yujie, et al.
Publicado: (2026)
OmniGen: Unified Image Generation
por: Xiao, Shitao, et al.
Publicado: (2024)
por: Xiao, Shitao, et al.
Publicado: (2024)
HumanOmni-Speaker: Identifying Who said What and When
por: Bai, Detao, et al.
Publicado: (2026)
por: Bai, Detao, et al.
Publicado: (2026)
VideoDPO: Omni-Preference Alignment for Video Diffusion Generation
por: Liu, Runtao, et al.
Publicado: (2024)
por: Liu, Runtao, et al.
Publicado: (2024)
OmniCam: Unified Multimodal Video Generation via Camera Control
por: Yang, Xiaoda, et al.
Publicado: (2025)
por: Yang, Xiaoda, et al.
Publicado: (2025)
HaploOmni: Unified Single Transformer for Multimodal Video Understanding and Generation
por: Xiao, Yicheng, et al.
Publicado: (2025)
por: Xiao, Yicheng, et al.
Publicado: (2025)
OmniVinci: Enhancing Architecture and Data for Omni-Modal Understanding LLM
por: Ye, Hanrong, et al.
Publicado: (2025)
por: Ye, Hanrong, et al.
Publicado: (2025)
Owl-1: Omni World Model for Consistent Long Video Generation
por: Huang, Yuanhui, et al.
Publicado: (2024)
por: Huang, Yuanhui, et al.
Publicado: (2024)
VITA: Towards Open-Source Interactive Omni Multimodal LLM
por: Fu, Chaoyou, et al.
Publicado: (2024)
por: Fu, Chaoyou, et al.
Publicado: (2024)
OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding
por: Zhao, Ruixiang, et al.
Publicado: (2026)
por: Zhao, Ruixiang, et al.
Publicado: (2026)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
por: Liu, Che, et al.
Publicado: (2026)
por: Liu, Che, et al.
Publicado: (2026)
OmniGenBench: A Benchmark for Omnipotent Multimodal Generation across 50+ Tasks
por: Wang, Jiayu, et al.
Publicado: (2025)
por: Wang, Jiayu, et al.
Publicado: (2025)
InteractiveOmni: A Unified Omni-modal Model for Audio-Visual Multi-turn Dialogue
por: Tong, Wenwen, et al.
Publicado: (2025)
por: Tong, Wenwen, et al.
Publicado: (2025)
Baichuan-Omni Technical Report
por: Li, Yadong, et al.
Publicado: (2024)
por: Li, Yadong, et al.
Publicado: (2024)
OmniScript: Towards Audio-Visual Script Generation for Long-Form Cinematic Video
por: Pu, Junfu, et al.
Publicado: (2026)
por: Pu, Junfu, et al.
Publicado: (2026)
OmniCT: Towards a Unified Slice-Volume LVLM for Comprehensive CT Analysis
por: Lin, Tianwei, et al.
Publicado: (2026)
por: Lin, Tianwei, et al.
Publicado: (2026)
Ejemplares similares
-
Sherlock: Towards Multi-scene Video Abnormal Event Extraction and Localization via a Global-local Spatial-sensitive LLM
por: Ma, Junxiao, et al.
Publicado: (2025) -
DeepSVU: Towards In-depth Security-oriented Video Understanding via Unified Physical-world Regularized MoE
por: Jin, Yujie, et al.
Publicado: (2026) -
OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs
por: Zhang, Yiman, et al.
Publicado: (2025) -
OmniNFT: Modality-wise Omni Diffusion Reinforcement for Joint Audio-Video Generation
por: Zhang, Guohui, et al.
Publicado: (2026) -
OmniVGGT: Omni-Modality Driven Visual Geometry Grounded Transformer
por: Peng, Haosong, et al.
Publicado: (2025)