Enhancing Human-Centered Dynamic Scene Understanding via Multiple LLMs Collaborated Reasoning
Fuente:
arXiv
Guardado en:
| Autores principales: | Zhang, Hang, Zhang, Wenxiao, Qu, Haoxuan, Liu, Jun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
por: Cai, Dongnuan, et al.
Publicado: (2026)
por: Cai, Dongnuan, et al.
Publicado: (2026)
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
por: Qu, Qiang, et al.
Publicado: (2025)
por: Qu, Qiang, et al.
Publicado: (2025)
XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning
por: Zhang, Hanwen, et al.
Publicado: (2026)
por: Zhang, Hanwen, et al.
Publicado: (2026)
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
por: Zhang, Yinghui, et al.
Publicado: (2025)
por: Zhang, Yinghui, et al.
Publicado: (2025)
Mitigating Easy Option Bias in Multiple-Choice Question Answering
por: Zhang, Hao, et al.
Publicado: (2025)
por: Zhang, Hao, et al.
Publicado: (2025)
MRD: Multi-resolution Retrieval-Detection Fusion for High-Resolution Image Understanding
por: Yang, Fan, et al.
Publicado: (2025)
por: Yang, Fan, et al.
Publicado: (2025)
Knowledge-enhanced Multi-perspective Video Representation Learning for Scene Recognition
por: Yu, Xuzheng, et al.
Publicado: (2024)
por: Yu, Xuzheng, et al.
Publicado: (2024)
LLM-EvRep: Learning an LLM-Compatible Event Representation Using a Self-Supervised Framework
por: Yu, Zongyou, et al.
Publicado: (2025)
por: Yu, Zongyou, et al.
Publicado: (2025)
Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding
por: Wang, Yun, et al.
Publicado: (2025)
por: Wang, Yun, et al.
Publicado: (2025)
Vision-and-Language Navigation with Analogical Textual Descriptions in LLMs
por: Zhang, Yue, et al.
Publicado: (2025)
por: Zhang, Yue, et al.
Publicado: (2025)
IVAC-P2L: Leveraging Irregular Repetition Priors for Improving Video Action Counting
por: Wang, Hang, et al.
Publicado: (2024)
por: Wang, Hang, et al.
Publicado: (2024)
TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning
por: Zeng, Xiangyu, et al.
Publicado: (2024)
por: Zeng, Xiangyu, et al.
Publicado: (2024)
Detecting Multimodal Situations with Insufficient Context and Abstaining from Baseless Predictions
por: Liu, Junzhang, et al.
Publicado: (2024)
por: Liu, Junzhang, et al.
Publicado: (2024)
Exploring Category-level Articulated Object Pose Tracking on SE(3) Manifolds
por: Meng, Xianhui, et al.
Publicado: (2025)
por: Meng, Xianhui, et al.
Publicado: (2025)
EvRepSL: Event-Stream Representation via Self-Supervised Learning for Event-Based Vision
por: Qu, Qiang, et al.
Publicado: (2024)
por: Qu, Qiang, et al.
Publicado: (2024)
DIBS: Enhancing Dense Video Captioning with Unlabeled Videos via Pseudo Boundary Enrichment and Online Refinement
por: Wu, Hao, et al.
Publicado: (2024)
por: Wu, Hao, et al.
Publicado: (2024)
MM-Point: Multi-View Information-Enhanced Multi-Modal Self-Supervised 3D Point Cloud Understanding
por: Yu, Hai-Tao, et al.
Publicado: (2024)
por: Yu, Hai-Tao, et al.
Publicado: (2024)
Multimodal LLMs Can Reason about Aesthetics in Zero-Shot
por: Jiang, Ruixiang, et al.
Publicado: (2025)
por: Jiang, Ruixiang, et al.
Publicado: (2025)
PointCoT: A Multi-modal Benchmark for Explicit 3D Geometric Reasoning
por: Zhang, Dongxu, et al.
Publicado: (2026)
por: Zhang, Dongxu, et al.
Publicado: (2026)
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
por: Zhang, Jun, et al.
Publicado: (2025)
por: Zhang, Jun, et al.
Publicado: (2025)
360+x: A Panoptic Multi-modal Scene Understanding Dataset
por: Chen, Hao, et al.
Publicado: (2024)
por: Chen, Hao, et al.
Publicado: (2024)
Enhancing Self-Supervised Talking Head Forgery Detection via a Training-Free Dual-System Framework
por: Liu, Ke, et al.
Publicado: (2026)
por: Liu, Ke, et al.
Publicado: (2026)
GaussianCross: Cross-modal Self-supervised 3D Representation Learning via Gaussian Splatting
por: Yao, Lei, et al.
Publicado: (2025)
por: Yao, Lei, et al.
Publicado: (2025)
Multi-modal and Multi-scale Spatial Environment Understanding for Immersive Visual Text-to-Speech
por: Liu, Rui, et al.
Publicado: (2024)
por: Liu, Rui, et al.
Publicado: (2024)
Composing Concepts from Images and Videos via Concept-prompt Binding
por: Kong, Xianghao, et al.
Publicado: (2025)
por: Kong, Xianghao, et al.
Publicado: (2025)
A Survey on Generative AI and LLM for Video Generation, Understanding, and Streaming
por: Zhou, Pengyuan, et al.
Publicado: (2024)
por: Zhou, Pengyuan, et al.
Publicado: (2024)
Q-Ponder: A Unified Training Pipeline for Reasoning-based Visual Quality Assessment
por: Cai, Zhuoxuan, et al.
Publicado: (2025)
por: Cai, Zhuoxuan, et al.
Publicado: (2025)
CLCR: Cross-Level Semantic Collaborative Representation for Multimodal Learning
por: Meng, Chunlei, et al.
Publicado: (2026)
por: Meng, Chunlei, et al.
Publicado: (2026)
Open-o3-Video: Grounded Video Reasoning with Explicit Spatio-Temporal Evidence
por: Meng, Jiahao, et al.
Publicado: (2025)
por: Meng, Jiahao, et al.
Publicado: (2025)
MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance
por: Zhang, Yuang, et al.
Publicado: (2024)
por: Zhang, Yuang, et al.
Publicado: (2024)
VRBench: A Benchmark for Multi-Step Reasoning in Long Narrative Videos
por: Yu, Jiashuo, et al.
Publicado: (2025)
por: Yu, Jiashuo, et al.
Publicado: (2025)
MIRROR: Multi-Modal Pathological Self-Supervised Representation Learning via Modality Alignment and Retention
por: Wang, Tianyi, et al.
Publicado: (2025)
por: Wang, Tianyi, et al.
Publicado: (2025)
Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering
por: Zhang, Yanjie, et al.
Publicado: (2026)
por: Zhang, Yanjie, et al.
Publicado: (2026)
DyRoNet: Dynamic Routing and Low-Rank Adapters for Autonomous Driving Streaming Perception
por: Huang, Xiang, et al.
Publicado: (2024)
por: Huang, Xiang, et al.
Publicado: (2024)
AI-Driven Virtual Teacher for Enhanced Educational Efficiency: Leveraging Large Pretrain Models for Autonomous Error Analysis and Correction
por: Xu, Tianlong, et al.
Publicado: (2024)
por: Xu, Tianlong, et al.
Publicado: (2024)
Efficient Low-Resolution Face Recognition via Bridge Distillation
por: Ge, Shiming, et al.
Publicado: (2024)
por: Ge, Shiming, et al.
Publicado: (2024)
Hierarchical Knowledge Graphs for Story Understanding in Visual Narratives
por: Chen, Yi-Chun
Publicado: (2025)
por: Chen, Yi-Chun
Publicado: (2025)
Concept Conductor: Orchestrating Multiple Personalized Concepts in Text-to-Image Synthesis
por: Yao, Zebin, et al.
Publicado: (2024)
por: Yao, Zebin, et al.
Publicado: (2024)
HiSC4D: Human-centered interaction and 4D Scene Capture in Large-scale Space Using Wearable IMUs and LiDAR
por: Dai, Yudi, et al.
Publicado: (2024)
por: Dai, Yudi, et al.
Publicado: (2024)
Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation
por: Liu, Che, et al.
Publicado: (2026)
por: Liu, Che, et al.
Publicado: (2026)
Ejemplares similares
-
Crab$^{+}$: A Scalable and Unified Audio-Visual Scene Understanding Model with Explicit Cooperation
por: Cai, Dongnuan, et al.
Publicado: (2026) -
EvAnimate: Event-conditioned Image-to-Video Generation for Human Animation
por: Qu, Qiang, et al.
Publicado: (2025) -
XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning
por: Zhang, Hanwen, et al.
Publicado: (2026) -
Enhanced Multimodal Hate Video Detection via Channel-wise and Modality-wise Fusion
por: Zhang, Yinghui, et al.
Publicado: (2025) -
Mitigating Easy Option Bias in Multiple-Choice Question Answering
por: Zhang, Hao, et al.
Publicado: (2025)