Universal Scene Graph Generation
Fuente:
arXiv
Salvato in:
| Autori principali: | Wu, Shengqiong, Fei, Hao, Chua, Tat-Seng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
di: Fei, Hao, et al.
Pubblicazione: (2024)
di: Fei, Hao, et al.
Pubblicazione: (2024)
Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation
di: Jin, Kaiming, et al.
Pubblicazione: (2026)
di: Jin, Kaiming, et al.
Pubblicazione: (2026)
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
di: Fei, Hao, et al.
Pubblicazione: (2023)
di: Fei, Hao, et al.
Pubblicazione: (2023)
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
di: Fei, Hao, et al.
Pubblicazione: (2024)
di: Fei, Hao, et al.
Pubblicazione: (2024)
Combating Multimodal LLM Hallucination via Bottom-Up Holistic Reasoning
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
Towards Semantic Equivalence of Tokenization in Multimodal LLM
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
di: Wu, Shengqiong, et al.
Pubblicazione: (2024)
Modeling Cross-vision Synergy for Unified Large Vision Model
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
A Reason-then-Describe Instruction Interpreter for Controllable Video Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
JavisDiT++: Unified Modeling and Optimization for Joint Audio-Video Generation
di: Liu, Kai, et al.
Pubblicazione: (2026)
di: Liu, Kai, et al.
Pubblicazione: (2026)
Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
di: Wu, Shengqiong, et al.
Pubblicazione: (2026)
Understanding Long Videos via LLM-Powered Entity Relation Graphs
di: Chu, Meng, et al.
Pubblicazione: (2025)
di: Chu, Meng, et al.
Pubblicazione: (2025)
Any2Caption:Interpreting Any Condition to Caption for Controllable Video Generation
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
di: Wu, Shengqiong, et al.
Pubblicazione: (2025)
Compose Your Aesthetics: Empowering Text-to-Image Models with the Principles of Art
di: Jin, Zhe, et al.
Pubblicazione: (2025)
di: Jin, Zhe, et al.
Pubblicazione: (2025)
Extending Visual Dynamics for Video-to-Music Generation
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
di: Liu, Xiaohao, et al.
Pubblicazione: (2025)
Disentangling Masked Autoencoders for Unsupervised Domain Generalization
di: Zhang, An, et al.
Pubblicazione: (2024)
di: Zhang, An, et al.
Pubblicazione: (2024)
DNA: Uncovering Universal Latent Forgery Knowledge
di: Dou, Jingtong, et al.
Pubblicazione: (2026)
di: Dou, Jingtong, et al.
Pubblicazione: (2026)
Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model
di: Shen, Fei, et al.
Pubblicazione: (2025)
di: Shen, Fei, et al.
Pubblicazione: (2025)
JavisGPT: A Unified Multi-modal LLM for Sounding-Video Comprehension and Generation
di: Liu, Kai, et al.
Pubblicazione: (2025)
di: Liu, Kai, et al.
Pubblicazione: (2025)
Zero-1-to-A: Zero-Shot One Image to Animatable Head Avatars Using Video Diffusion
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning
di: Qian, Long, et al.
Pubblicazione: (2024)
di: Qian, Long, et al.
Pubblicazione: (2024)
TextVidBench: A Benchmark for Long Video Scene Text Understanding
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
di: Zhong, Yangyang, et al.
Pubblicazione: (2025)
UniFGVC: Universal Training-Free Few-Shot Fine-Grained Vision Classification via Attribute-Aware Multimodal Retrieval
di: Guo, Hongyu, et al.
Pubblicazione: (2025)
di: Guo, Hongyu, et al.
Pubblicazione: (2025)
Scene-Text Grounding for Text-Based Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
di: Zhou, Sheng, et al.
Pubblicazione: (2024)
Turing Patterns for Multimedia: Reaction-Diffusion Multi-Modal Fusion for Language-Guided Video Moment Retrieval
di: Fang, Xiang, et al.
Pubblicazione: (2026)
di: Fang, Xiang, et al.
Pubblicazione: (2026)
Composed Image Retrieval with Text Feedback via Multi-grained Uncertainty Regularization
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
di: Chen, Yiyang, et al.
Pubblicazione: (2022)
3D Magic Mirror: Clothing Reconstruction from a Single Image via a Causal Perspective
di: Zheng, Zhedong, et al.
Pubblicazione: (2022)
di: Zheng, Zhedong, et al.
Pubblicazione: (2022)
Precise Shield: Explaining and Aligning VLLM Safety via Neuron-Level Guidance
di: Shi, Enyi, et al.
Pubblicazione: (2026)
di: Shi, Enyi, et al.
Pubblicazione: (2026)
Orthogonal Spatial-temporal Distributional Transfer for 4D Generation
di: Liu, Wei, et al.
Pubblicazione: (2026)
di: Liu, Wei, et al.
Pubblicazione: (2026)
Towards Modality Generalization: A Benchmark and Prospective Analysis
di: Liu, Xiaohao, et al.
Pubblicazione: (2024)
di: Liu, Xiaohao, et al.
Pubblicazione: (2024)
JavisDiT: Joint Audio-Video Diffusion Transformer with Hierarchical Spatio-Temporal Prior Synchronization
di: Liu, Kai, et al.
Pubblicazione: (2025)
di: Liu, Kai, et al.
Pubblicazione: (2025)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
Beyond Surface Artifacts: Capturing Shared Latent Forgery Knowledge Across Modalities
di: Dou, Jingtong, et al.
Pubblicazione: (2026)
di: Dou, Jingtong, et al.
Pubblicazione: (2026)
UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist
di: Liang, Zhengyang, et al.
Pubblicazione: (2025)
di: Liang, Zhengyang, et al.
Pubblicazione: (2025)
Reasoning-VLA: A Fast and General Vision-Language-Action Reasoning Model for Autonomous Driving
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
di: Zhang, Dapeng, et al.
Pubblicazione: (2025)
Towards Natural Language-Guided Drones: GeoText-1652 Benchmark with Spatial Relation Matching
di: Chu, Meng, et al.
Pubblicazione: (2023)
di: Chu, Meng, et al.
Pubblicazione: (2023)
Can I Trust Your Answer? Visually Grounded Video Question Answering
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
di: Xiao, Junbin, et al.
Pubblicazione: (2023)
Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models
di: Shi, Enyi, et al.
Pubblicazione: (2026)
di: Shi, Enyi, et al.
Pubblicazione: (2026)
ITS3D: Inference-Time Scaling for Text-Guided 3D Diffusion Models
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
di: Zhou, Zhenglin, et al.
Pubblicazione: (2025)
Multiple-environment Self-adaptive Network for Aerial-view Geo-localization
di: Wang, Tingyu, et al.
Pubblicazione: (2022)
di: Wang, Tingyu, et al.
Pubblicazione: (2022)
Documenti analoghi
-
Learning 4D Panoptic Scene Graph Generation from Rich 2D Visual Scene
di: Wu, Shengqiong, et al.
Pubblicazione: (2025) -
Vitron: A Unified Pixel-level Vision LLM for Understanding, Generating, Segmenting, Editing
di: Fei, Hao, et al.
Pubblicazione: (2024) -
Global Commander and Local Operative: A Dual-Agent Framework for Scene Navigation
di: Jin, Kaiming, et al.
Pubblicazione: (2026) -
Dysen-VDM: Empowering Dynamics-aware Text-to-Video Diffusion with LLMs
di: Fei, Hao, et al.
Pubblicazione: (2023) -
Enhancing Video-Language Representations with Structural Spatio-Temporal Alignment
di: Fei, Hao, et al.
Pubblicazione: (2024)