Robust 4D Visual Geometry Transformer with Uncertainty-Aware Priors
Fuente:
arXiv
Salvato in:
| Autori principali: | Zang, Ying, Han, Yidong, Ding, Chaotao, Hu, Yuanqi, Ji, Deyi, Zhu, Qi, Li, Xuanfu, Ma, Jin, Sun, Lingyun, Chen, Tianrun, Zhu, Lanyun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation
di: Zang, Ying, et al.
Pubblicazione: (2026)
di: Zang, Ying, et al.
Pubblicazione: (2026)
HD-VGGT: High-Resolution Visual Geometry Transformer
di: Chen, Tianrun, et al.
Pubblicazione: (2026)
di: Chen, Tianrun, et al.
Pubblicazione: (2026)
StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression
di: Liu, Xuanyi, et al.
Pubblicazione: (2026)
di: Liu, Xuanyi, et al.
Pubblicazione: (2026)
xLSTM-UNet can be an Effective 2D & 3D Medical Image Segmentation Backbone with Vision-LSTM (ViL) better than its Mamba Counterpart
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
SAM2-Adapter: Evaluating & Adapting Segment Anything 2 in Downstream Tasks: Camouflage, Shadow, Medical Image Segmentation, and More
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
Magic3DSketch: Create Colorful 3D Models From Sketch-Based 3D Modeling Guided by Text and Language-Image Pre-Training
di: Zang, Ying, et al.
Pubblicazione: (2024)
di: Zang, Ying, et al.
Pubblicazione: (2024)
Syllables to Scenes: Literary-Guided Free-Viewpoint 3D Scene Synthesis from Japanese Haiku
di: Yu, Chunan, et al.
Pubblicazione: (2025)
di: Yu, Chunan, et al.
Pubblicazione: (2025)
SAM3-Adapter: Efficient Adaptation of Segment Anything 3 for Camouflage Object Segmentation, Shadow Detection, and Medical Image Segmentation
di: Chen, Tianrun, et al.
Pubblicazione: (2025)
di: Chen, Tianrun, et al.
Pubblicazione: (2025)
RAVEN: Robust Advertisement Video Violation Temporal Grounding via Reinforcement Reasoning
di: Ji, Deyi, et al.
Pubblicazione: (2025)
di: Ji, Deyi, et al.
Pubblicazione: (2025)
From Air to Wear: Personalized 3D Digital Fashion with AR/VR Immersive 3D Sketching
di: Zang, Ying, et al.
Pubblicazione: (2025)
di: Zang, Ying, et al.
Pubblicazione: (2025)
Let Human Sketches Help: Empowering Challenging Image Segmentation Task with Freehand Sketches
di: Zang, Ying, et al.
Pubblicazione: (2025)
di: Zang, Ying, et al.
Pubblicazione: (2025)
Retrv-R1: A Reasoning-Driven MLLM Framework for Universal and Efficient Multimodal Retrieval
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
Not Every Patch is Needed: Towards a More Efficient and Effective Backbone for Video-based Person Re-identification
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
LLaFS: When Large Language Models Meet Few-Shot Segmentation
di: Zhu, Lanyun, et al.
Pubblicazione: (2023)
di: Zhu, Lanyun, et al.
Pubblicazione: (2023)
Img2CAD: Conditioned 3D CAD Model Generation from Single Image with Structured Visual Geometry
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
Reasoning3D -- Grounding and Reasoning in 3D: Fine-Grained Zero-Shot Open-Vocabulary 3D Reasoning Part Segmentation via Large Vision-Language Models
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
di: Chen, Tianrun, et al.
Pubblicazione: (2024)
Breaking the Box: Enhancing Remote Sensing Image Segmentation with Freehand Sketches
di: Zang, Ying, et al.
Pubblicazione: (2025)
di: Zang, Ying, et al.
Pubblicazione: (2025)
IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding
di: Zhu, Lanyun, et al.
Pubblicazione: (2024)
di: Zhu, Lanyun, et al.
Pubblicazione: (2024)
RESMatch: Referring Expression Segmentation in a Semi-Supervised Manner
di: Zang, Ying, et al.
Pubblicazione: (2024)
di: Zang, Ying, et al.
Pubblicazione: (2024)
CamGeo: Sparse Camera-Conditioned Image-to-Video Generation with 3D Geometry Priors
di: Liu, Xuanyi, et al.
Pubblicazione: (2026)
di: Liu, Xuanyi, et al.
Pubblicazione: (2026)
POPEN: Preference-Based Optimization and Ensemble for LVLM-Based Reasoning Segmentation
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
di: Zhu, Lanyun, et al.
Pubblicazione: (2025)
Self-signals Driven Multi-LLM Debate for Efficient and Accurate Reasoning
di: Chen, Xuhang, et al.
Pubblicazione: (2025)
di: Chen, Xuhang, et al.
Pubblicazione: (2025)
Discrete Latent Perspective Learning for Segmentation and Detection
di: Ji, Deyi, et al.
Pubblicazione: (2024)
di: Ji, Deyi, et al.
Pubblicazione: (2024)
StreamSense: Streaming Social Task Detection with Selective Vision-Language Model Routing
di: Wang, Han, et al.
Pubblicazione: (2026)
di: Wang, Han, et al.
Pubblicazione: (2026)
RAVEN++: Pinpointing Fine-Grained Violations in Advertisement Videos with Active Reinforcement Reasoning
di: Ji, Deyi, et al.
Pubblicazione: (2025)
di: Ji, Deyi, et al.
Pubblicazione: (2025)
Aligning LLM Uncertainty with Human Disagreement in Subjectivity Analysis
di: Lu, Junyu, et al.
Pubblicazione: (2026)
di: Lu, Junyu, et al.
Pubblicazione: (2026)
Uncertainty-Aware Robust Learning on Noisy Graphs
di: Chen, Shuyi, et al.
Pubblicazione: (2023)
di: Chen, Shuyi, et al.
Pubblicazione: (2023)
Video-Zero: Self-Evolution Video Understanding
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
di: Zhang, Ruixu, et al.
Pubblicazione: (2026)
Tree-of-Table: Unleashing the Power of LLMs for Enhanced Large-Scale Table Understanding
di: Ji, Deyi, et al.
Pubblicazione: (2024)
di: Ji, Deyi, et al.
Pubblicazione: (2024)
View-Centric Multi-Object Tracking with Homographic Matching in Moving UAV
di: Ji, Deyi, et al.
Pubblicazione: (2024)
di: Ji, Deyi, et al.
Pubblicazione: (2024)
Geometry-Aware Uncertainty Coresets for Robust Visual In-Context Learning in Histopathology
di: Erick, Franciskus Xaverius, et al.
Pubblicazione: (2026)
di: Erick, Franciskus Xaverius, et al.
Pubblicazione: (2026)
Claw AI Lab: An Autonomous Multi-Agent Research Team
di: Wu, Fan, et al.
Pubblicazione: (2026)
di: Wu, Fan, et al.
Pubblicazione: (2026)
Context and Geometry Aware Voxel Transformer for Semantic Scene Completion
di: Yu, Zhu, et al.
Pubblicazione: (2024)
di: Yu, Zhu, et al.
Pubblicazione: (2024)
Multi-Agent VLMs Guided Self-Training with PNU Loss for Low-Resource Offensive Content Detection
di: Wang, Han, et al.
Pubblicazione: (2025)
di: Wang, Han, et al.
Pubblicazione: (2025)
Towards Trustworthy Web Attack Detection: An Uncertainty-Aware Ensemble Deep Kernel Learning Model
di: Zhou, Yonghang, et al.
Pubblicazione: (2024)
di: Zhou, Yonghang, et al.
Pubblicazione: (2024)
PPTFormer: Pseudo Multi-Perspective Transformer for UAV Segmentation
di: Ji, Deyi, et al.
Pubblicazione: (2024)
di: Ji, Deyi, et al.
Pubblicazione: (2024)
Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking
di: Zhu, Deyi, et al.
Pubblicazione: (2026)
di: Zhu, Deyi, et al.
Pubblicazione: (2026)
Conditional Image Prior for Uncertainty Quantification in Full Waveform Inversion
di: Yang, Lingyun, et al.
Pubblicazione: (2024)
di: Yang, Lingyun, et al.
Pubblicazione: (2024)
Uncertainty-Aware Jamming Mitigation with Active RIS: A Robust Stackelberg Game Approach
di: Tang, Xiao, et al.
Pubblicazione: (2026)
di: Tang, Xiao, et al.
Pubblicazione: (2026)
Beyond Uncertainty: Evidential Deep Learning for Robust Video Temporal Grounding
di: Ma, Kaijing, et al.
Pubblicazione: (2024)
di: Ma, Kaijing, et al.
Pubblicazione: (2024)
Documenti analoghi
-
4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation
di: Zang, Ying, et al.
Pubblicazione: (2026) -
HD-VGGT: High-Resolution Visual Geometry Transformer
di: Chen, Tianrun, et al.
Pubblicazione: (2026) -
StreamCacheVGGT: Streaming Visual Geometry Transformers with Robust Scoring and Hybrid Cache Compression
di: Liu, Xuanyi, et al.
Pubblicazione: (2026) -
xLSTM-UNet can be an Effective 2D & 3D Medical Image Segmentation Backbone with Vision-LSTM (ViL) better than its Mamba Counterpart
di: Chen, Tianrun, et al.
Pubblicazione: (2024) -
SAM2-Adapter: Evaluating & Adapting Segment Anything 2 in Downstream Tasks: Camouflage, Shadow, Medical Image Segmentation, and More
di: Chen, Tianrun, et al.
Pubblicazione: (2024)