Salvato in:
| Autori principali: | Zhou, Shengli, Zhu, Jianuo, Huang, Qilin, Wang, Fangjing, Zhang, Yanfu, Zheng, Feng |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | https://arxiv.org/abs/2507.01800 |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
di: Zhou, Shengli, et al.
Pubblicazione: (2026)
di: Zhou, Shengli, et al.
Pubblicazione: (2026)
A Hierarchical Compression Technique for 3D Gaussian Splatting Compression
di: Huang, He, et al.
Pubblicazione: (2024)
di: Huang, He, et al.
Pubblicazione: (2024)
GaussianForest: Hierarchical-Hybrid 3D Gaussian Splatting for Compressed Scene Modeling
di: Zhang, Fengyi, et al.
Pubblicazione: (2024)
di: Zhang, Fengyi, et al.
Pubblicazione: (2024)
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
di: Zhou, Sheng, et al.
Pubblicazione: (2025)
Modularized Zero-shot VQA with Pre-trained Models
di: Cao, Rui, et al.
Pubblicazione: (2023)
di: Cao, Rui, et al.
Pubblicazione: (2023)
DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment
di: Li, Xinyue, et al.
Pubblicazione: (2026)
di: Li, Xinyue, et al.
Pubblicazione: (2026)
UniAV: Unified Audio-Visual Perception for Multi-Task Video Event Localization
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
di: Geng, Tiantian, et al.
Pubblicazione: (2024)
Context-aware TFL: A Universal Context-aware Contrastive Learning Framework for Temporal Forgery Localization
di: Yin, Qilin, et al.
Pubblicazione: (2025)
di: Yin, Qilin, et al.
Pubblicazione: (2025)
Hierarchical Action Recognition: A Contrastive Video-Language Approach with Hierarchical Interactions
di: Zhang, Rui, et al.
Pubblicazione: (2024)
di: Zhang, Rui, et al.
Pubblicazione: (2024)
Zero-Shot Visual Grounding in 3D Gaussians via View Retrieval
di: Liao, Liwei, et al.
Pubblicazione: (2025)
di: Liao, Liwei, et al.
Pubblicazione: (2025)
Hierarchical Refinement of Universal Multimodal Attacks on Vision-Language Models
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
di: Zhang, Peng-Fei, et al.
Pubblicazione: (2026)
Towards Signboard-Oriented Visual Question Answering: ViSignVQA Dataset, Method and Benchmark
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
di: Nguyen, Hieu Minh, et al.
Pubblicazione: (2025)
Adaptive 3D Gaussian Splatting Video Streaming
di: Gong, Han, et al.
Pubblicazione: (2025)
di: Gong, Han, et al.
Pubblicazione: (2025)
Learning Brain Representation with Hierarchical Visual Embeddings
di: Zheng, Jiawen, et al.
Pubblicazione: (2026)
di: Zheng, Jiawen, et al.
Pubblicazione: (2026)
Querying Autonomous Vehicle Point Clouds: Enhanced by 3D Object Counting with CounterNet
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2025)
di: Zhang, Xiaoyu, et al.
Pubblicazione: (2025)
ReLaX-VQA: Residual Fragment and Layer Stack Extraction for Enhancing Video Quality Assessment
di: Wang, Xinyi, et al.
Pubblicazione: (2024)
di: Wang, Xinyi, et al.
Pubblicazione: (2024)
EAR: Enhancing Uni-Modal Representations for Weakly Supervised Audio-Visual Video Parsing
di: Li, Huilai, et al.
Pubblicazione: (2026)
di: Li, Huilai, et al.
Pubblicazione: (2026)
Hierarchical Masked Autoregressive Models with Low-Resolution Token Pivots
di: Zheng, Guangting, et al.
Pubblicazione: (2025)
di: Zheng, Guangting, et al.
Pubblicazione: (2025)
Advancing Weakly-Supervised Audio-Visual Video Parsing via Segment-wise Pseudo Labeling
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
di: Zhou, Jinxing, et al.
Pubblicazione: (2024)
Enhancing Vision-Language Tracking by Effectively Converting Textual Cues into Visual Cues
di: Feng, X., et al.
Pubblicazione: (2024)
di: Feng, X., et al.
Pubblicazione: (2024)
Hierarchical Sub-action Tree for Continuous Sign Language Recognition
di: Yang, Dejie, et al.
Pubblicazione: (2025)
di: Yang, Dejie, et al.
Pubblicazione: (2025)
Enhancing 3D Gaussian Splatting Compression via Spatial Condition-based Prediction
di: Ma, Jingui, et al.
Pubblicazione: (2025)
di: Ma, Jingui, et al.
Pubblicazione: (2025)
DanceCamera3D: 3D Camera Movement Synthesis with Music and Dance
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
di: Wang, Zixuan, et al.
Pubblicazione: (2024)
Optimizing Multimodal LLMs for Egocentric Video Understanding: A Solution for the HD-EPIC VQA Challenge
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
di: Yang, Sicheng, et al.
Pubblicazione: (2026)
VideoForest: Person-Anchored Hierarchical Reasoning for Cross-Video Question Answering
di: Meng, Yiran, et al.
Pubblicazione: (2025)
di: Meng, Yiran, et al.
Pubblicazione: (2025)
Hierarchical Textual Knowledge for Enhanced Image Clustering
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
di: Zhong, Yijie, et al.
Pubblicazione: (2026)
Mono3DVG-EnSD: Enhanced Spatial-aware and Dimension-decoupled Text Encoding for Monocular 3D Visual Grounding
di: Li, Yuzhen, et al.
Pubblicazione: (2025)
di: Li, Yuzhen, et al.
Pubblicazione: (2025)
HiScene: Creating Hierarchical 3D Scenes with Isometric View Generation
di: Dong, Wenqi, et al.
Pubblicazione: (2025)
di: Dong, Wenqi, et al.
Pubblicazione: (2025)
DIVA-VQA: Detecting Inter-frame Variations in UGC Video Quality
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
SCENEFORGE: Enhancing 3D-text alignment with Structured Scene Compositions
di: Sbrolli, Cristian, et al.
Pubblicazione: (2025)
di: Sbrolli, Cristian, et al.
Pubblicazione: (2025)
MVBIND: Self-Supervised Music Recommendation For Videos Via Embedding Space Binding
di: Teng, Jiajie, et al.
Pubblicazione: (2024)
di: Teng, Jiajie, et al.
Pubblicazione: (2024)
Learn 3D VQA Better with Active Selection and Reannotation
di: Zhou, Shengli, et al.
Pubblicazione: (2025)
di: Zhou, Shengli, et al.
Pubblicazione: (2025)
Learning Generalizable and Efficient Image Watermarking via Hierarchical Two-Stage Optimization
di: Liu, Ke, et al.
Pubblicazione: (2025)
di: Liu, Ke, et al.
Pubblicazione: (2025)
Anchoring Emotions in Text: Robust Multimodal Fusion for Mimicry Intensity Estimation
di: Zhu, Lingsi, et al.
Pubblicazione: (2026)
di: Zhu, Lingsi, et al.
Pubblicazione: (2026)
MM-Point: Multi-View Information-Enhanced Multi-Modal Self-Supervised 3D Point Cloud Understanding
di: Yu, Hai-Tao, et al.
Pubblicazione: (2024)
di: Yu, Hai-Tao, et al.
Pubblicazione: (2024)
Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection
di: Zhu, Sa, et al.
Pubblicazione: (2026)
di: Zhu, Sa, et al.
Pubblicazione: (2026)
Enhancing Interactive Image Retrieval With Query Rewriting Using Large Language Models and Vision Language Models
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
di: Zhu, Hongyi, et al.
Pubblicazione: (2024)
InstructHumans: Editing Animated 3D Human Textures with Instructions
di: Zhu, Jiayin, et al.
Pubblicazione: (2024)
di: Zhu, Jiayin, et al.
Pubblicazione: (2024)
Ego3DT: Tracking Every 3D Object in Ego-centric Videos
di: Hao, Shengyu, et al.
Pubblicazione: (2024)
di: Hao, Shengyu, et al.
Pubblicazione: (2024)
ASAP: Advancing Semantic Alignment Promotes Multi-Modal Manipulation Detecting and Grounding
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
di: Zhang, Zhenxing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Scalable Object Relation Encoding for Better 3D Spatial Reasoning in Large Language Models
di: Zhou, Shengli, et al.
Pubblicazione: (2026) -
A Hierarchical Compression Technique for 3D Gaussian Splatting Compression
di: Huang, He, et al.
Pubblicazione: (2024) -
GaussianForest: Hierarchical-Hybrid 3D Gaussian Splatting for Compressed Scene Modeling
di: Zhang, Fengyi, et al.
Pubblicazione: (2024) -
EgoTextVQA: Towards Egocentric Scene-Text Aware Video Question Answering
di: Zhou, Sheng, et al.
Pubblicazione: (2025) -
Modularized Zero-shot VQA with Pre-trained Models
di: Cao, Rui, et al.
Pubblicazione: (2023)