3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Zhang, Jusheng, Fan, Yijia, Wen, Zimo, Wang, Jian, Wang, Keze |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2026
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
MAT-Agent: Adaptive Multi-Agent Training Optimization
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation
von: Wang, Yihao, et al.
Veröffentlicht: (2026)
von: Wang, Yihao, et al.
Veröffentlicht: (2026)
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
von: Ding, Yanbo, et al.
Veröffentlicht: (2024)
von: Ding, Yanbo, et al.
Veröffentlicht: (2024)
TriCLIP-3D: A Unified Parameter-Efficient Framework for Tri-Modal 3D Visual Grounding based on CLIP
von: Li, Fan, et al.
Veröffentlicht: (2025)
von: Li, Fan, et al.
Veröffentlicht: (2025)
CoAgent: Collaborative Planning and Consistency Agent for Coherent Video Generation
von: Zeng, Qinglin, et al.
Veröffentlicht: (2025)
von: Zeng, Qinglin, et al.
Veröffentlicht: (2025)
Top-Down Semantic Refinement for Image Captioning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Agent-GSPO: Communication-Efficient Multi-Agent Systems via Group Sequence Policy Optimization
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
von: Fan, Yijia, et al.
Veröffentlicht: (2025)
OSC: Cognitive Orchestration through Dynamic Knowledge Alignment in Multi-Agent LLM Collaboration
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
Process-of-Thought Reasoning for Videos
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2026)
PTTA: A Pure Text-to-Animation Framework for High-Quality Creation
von: Chen, Ruiqi, et al.
Veröffentlicht: (2025)
von: Chen, Ruiqi, et al.
Veröffentlicht: (2025)
SC3D: Label-Efficient Outdoor 3D Object Detection via Single Click Annotation
von: Xia, Qiming, et al.
Veröffentlicht: (2024)
von: Xia, Qiming, et al.
Veröffentlicht: (2024)
AW-MoE: All-Weather Mixture of Experts for Robust Multi-Modal 3D Object Detection
von: Lin, Hongwei, et al.
Veröffentlicht: (2026)
von: Lin, Hongwei, et al.
Veröffentlicht: (2026)
MuTri: Multi-view Tri-alignment for OCT to OCTA 3D Image Translation
von: Chen, Zhuangzhuang, et al.
Veröffentlicht: (2025)
von: Chen, Zhuangzhuang, et al.
Veröffentlicht: (2025)
VULCAN: Tool-Augmented Multi Agents for Iterative 3D Object Arrangement
von: Kuang, Zhengfei, et al.
Veröffentlicht: (2025)
von: Kuang, Zhengfei, et al.
Veröffentlicht: (2025)
MM-CoT:A Benchmark for Probing Visual Chain-of-Thought Reasoning in Multimodal Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
CoDiff: Conditional Diffusion Model for Collaborative 3D Object Detection
von: Huang, Zhe, et al.
Veröffentlicht: (2025)
von: Huang, Zhe, et al.
Veröffentlicht: (2025)
Hyperbolic Distillation: Geometry-Guided Cross-Modal Transfer for Robust 3D Object Detection
von: Ning, Kanglin, et al.
Veröffentlicht: (2026)
von: Ning, Kanglin, et al.
Veröffentlicht: (2026)
MMScan: A Multi-Modal 3D Scene Dataset with Hierarchical Grounded Language Annotations
von: Lyu, Ruiyuan, et al.
Veröffentlicht: (2024)
von: Lyu, Ruiyuan, et al.
Veröffentlicht: (2024)
MonoSOWA: Scalable monocular 3D Object detector Without human Annotations
von: Skvrna, Jan, et al.
Veröffentlicht: (2025)
von: Skvrna, Jan, et al.
Veröffentlicht: (2025)
EarthCrafter: Scalable 3D Earth Generation via Dual-Sparse Latent Diffusion
von: Liu, Shang, et al.
Veröffentlicht: (2025)
von: Liu, Shang, et al.
Veröffentlicht: (2025)
DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation
von: Wang, Zirui, et al.
Veröffentlicht: (2025)
von: Wang, Zirui, et al.
Veröffentlicht: (2025)
MM-Mixing: Multi-Modal Mixing Alignment for 3D Understanding
von: Wang, Jiaze, et al.
Veröffentlicht: (2024)
von: Wang, Jiaze, et al.
Veröffentlicht: (2024)
Diffusion-Based Restoration for Multi-Modal 3D Object Detection in Adverse Weather
von: He, Zhijian, et al.
Veröffentlicht: (2025)
von: He, Zhijian, et al.
Veröffentlicht: (2025)
Semantic Compression of 3D Objects for Open and Collaborative Virtual Worlds
von: Dotzel, Jordan, et al.
Veröffentlicht: (2025)
von: Dotzel, Jordan, et al.
Veröffentlicht: (2025)
GrabS: Generative Embodied Agent for 3D Object Segmentation without Scene Supervision
von: Zhang, Zihui, et al.
Veröffentlicht: (2025)
von: Zhang, Zihui, et al.
Veröffentlicht: (2025)
3DrawAgent: Teaching LLM to Draw in 3D with Early Contrastive Experience
von: Xiao, Hongcan, et al.
Veröffentlicht: (2026)
von: Xiao, Hongcan, et al.
Veröffentlicht: (2026)
FlashVLM: Text-Guided Visual Token Selection for Large Multimodal Models
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
von: Cai, Kaitong, et al.
Veröffentlicht: (2025)
HOT3D: Hand and Object Tracking in 3D from Egocentric Multi-View Videos
von: Banerjee, Prithviraj, et al.
Veröffentlicht: (2024)
von: Banerjee, Prithviraj, et al.
Veröffentlicht: (2024)
MultiCorrupt: A Multi-Modal Robustness Dataset and Benchmark of LiDAR-Camera Fusion for 3D Object Detection
von: Beemelmanns, Till, et al.
Veröffentlicht: (2024)
von: Beemelmanns, Till, et al.
Veröffentlicht: (2024)
MHMamba: Multi-Head Mamba for 3D Brain Tumor Segmentation
von: Tao, Hanjun, et al.
Veröffentlicht: (2026)
von: Tao, Hanjun, et al.
Veröffentlicht: (2026)
Towards Flexible 3D Perception: Object-Centric Occupancy Completion Augments 3D Object Detection
von: Zheng, Chaoda, et al.
Veröffentlicht: (2024)
von: Zheng, Chaoda, et al.
Veröffentlicht: (2024)
EMIFF: Enhanced Multi-scale Image Feature Fusion for Vehicle-Infrastructure Cooperative 3D Object Detection
von: Wang, Zhe, et al.
Veröffentlicht: (2024)
von: Wang, Zhe, et al.
Veröffentlicht: (2024)
GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025)
PAM: A Propagation-Based Model for Segmenting Any 3D Objects across Multi-Modal Medical Images
von: Chen, Zifan, et al.
Veröffentlicht: (2024)
von: Chen, Zifan, et al.
Veröffentlicht: (2024)
Pre-Trained Vision-Language Models as Partial Annotators
von: Wang, Qian-Wei, et al.
Veröffentlicht: (2024)
von: Wang, Qian-Wei, et al.
Veröffentlicht: (2024)
UniPre3D: Unified Pre-training of 3D Point Cloud Models with Cross-Modal Gaussian Splatting
von: Wang, Ziyi, et al.
Veröffentlicht: (2025)
von: Wang, Ziyi, et al.
Veröffentlicht: (2025)
Co-Fusion4D: Spatio-temporal Collaborative Fusion for Robust 3D Object Detection
von: Li, Wenxuan, et al.
Veröffentlicht: (2026)
von: Li, Wenxuan, et al.
Veröffentlicht: (2026)
Transparent Visual Reasoning via Object-Centric Agent Collaboration
von: Teoh, Benjamin, et al.
Veröffentlicht: (2025)
von: Teoh, Benjamin, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
MAT-Agent: Adaptive Multi-Agent Training Optimization
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025) -
ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation
von: Wang, Yihao, et al.
Veröffentlicht: (2026) -
HybridToken-VLM: Hybrid Token Compression for Vision-Language Models
von: Zhang, Jusheng, et al.
Veröffentlicht: (2025) -
3DAlign-DAER: Dynamic Attention Policy and Efficient Retrieval Strategy for Fine-grained 3D-Text Alignment at Scale
von: Fan, Yijia, et al.
Veröffentlicht: (2025) -
MUSES: 3D-Controllable Image Generation via Multi-Modal Agent Collaboration
von: Ding, Yanbo, et al.
Veröffentlicht: (2024)