Argus: Leveraging Multiview Images for Improved 3-D Scene Understanding With Large Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Xu, Yifan, Zhang, Chao, Jiang, Hanqi, Wang, Xiaoyan, Ma, Ruifei, Li, Yiwei, Wu, Zihao, Li, Zeju, Liu, Xiangde |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
by: Li, Zeju, et al.
Published: (2024)
by: Li, Zeju, et al.
Published: (2024)
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
by: Wang, Xiaoyan, et al.
Published: (2025)
by: Wang, Xiaoyan, et al.
Published: (2025)
MMGDreamer: Mixed-Modality Graph for Geometry-Controllable 3D Indoor Scene Generation
by: Yang, Zhifei, et al.
Published: (2025)
by: Yang, Zhifei, et al.
Published: (2025)
Multiview Equivariance Improves 3D Correspondence Understanding with Minimal Feature Finetuning
by: You, Yang, et al.
Published: (2024)
by: You, Yang, et al.
Published: (2024)
Multiview Scene Graph
by: Zhang, Juexiao, et al.
Published: (2024)
by: Zhang, Juexiao, et al.
Published: (2024)
A Multiview‐Integrated Framework for Traffic Scene Understanding Based on YOLO and LLM
by: Yixuan Zhao, et al.
Published: (2026)
by: Yixuan Zhao, et al.
Published: (2026)
Multiview Subspace Clustering of Hyperspectral Images based on Graph Convolutional Networks
by: Li, Xianju, et al.
Published: (2024)
by: Li, Xianju, et al.
Published: (2024)
Argus Inspection: Do Multimodal Large Language Models Possess the Eye of Panoptes?
by: Yao, Yang, et al.
Published: (2025)
by: Yao, Yang, et al.
Published: (2025)
Language-Assisted 3D Scene Understanding
by: Wu, Yanmin, et al.
Published: (2023)
by: Wu, Yanmin, et al.
Published: (2023)
Text-Scene: A Scene-to-Language Parsing Framework for 3D Scene Understanding
by: Li, Haoyuan, et al.
Published: (2025)
by: Li, Haoyuan, et al.
Published: (2025)
HMR3D: Hierarchical Multimodal Representation for 3D Scene Understanding with Large Vision-Language Model
by: Li, Chen, et al.
Published: (2025)
by: Li, Chen, et al.
Published: (2025)
Extending Depth of Field for Varifocal Multiview Images
by: Li, Zhilong, et al.
Published: (2024)
by: Li, Zhilong, et al.
Published: (2024)
QueEn: A Large Language Model for Quechua-English Translation
by: Chen, Junhao, et al.
Published: (2024)
by: Chen, Junhao, et al.
Published: (2024)
Argus: Benchmarking and Enhancing Vision-Language Models for 3D Radiology Report Generation
by: Liu, Che, et al.
Published: (2024)
by: Liu, Che, et al.
Published: (2024)
Argus: Resilience-Oriented Safety Assurance Framework for End-to-End ADSs
by: Wang, Dingji, et al.
Published: (2025)
by: Wang, Dingji, et al.
Published: (2025)
ArtiScene: Language-Driven Artistic 3D Scene Generation Through Image Intermediary
by: Gu, Zeqi, et al.
Published: (2025)
by: Gu, Zeqi, et al.
Published: (2025)
A World Model of Radiologist Reading for Medical Image Representation Learning
by: Li, Yiwei, et al.
Published: (2026)
by: Li, Yiwei, et al.
Published: (2026)
EG-SpikeFormer: Eye-Gaze Guided Transformer on Spiking Neural Networks for Medical Image Analysis
by: Pan, Yi, et al.
Published: (2024)
by: Pan, Yi, et al.
Published: (2024)
Leveraging Large Language Models for Causal Discovery: a Constraint-based, Argumentation-driven Approach
by: Li, Zihao, et al.
Published: (2026)
by: Li, Zihao, et al.
Published: (2026)
Leveraging Retrieval-Augmented Tags for Large Vision-Language Understanding in Complex Scenes
by: Rivera, Antonio Carlos, et al.
Published: (2024)
by: Rivera, Antonio Carlos, et al.
Published: (2024)
Director: Instance-aware Gaussian Splatting for Dynamic Scene Modeling and Understanding
by: Jiang, Yuheng, et al.
Published: (2026)
by: Jiang, Yuheng, et al.
Published: (2026)
SpatialReasoner: Active Perception for Large-Scale 3D Scene Understanding
by: Zheng, Hongpei, et al.
Published: (2025)
by: Zheng, Hongpei, et al.
Published: (2025)
DeepRTL: Bridging Verilog Understanding and Generation with a Unified Representation Model
by: Liu, Yi, et al.
Published: (2025)
by: Liu, Yi, et al.
Published: (2025)
Leveraging 2D-VLM for Label-Free 3D Segmentation in Large-Scale Outdoor Scene Understanding
by: Nishimura, Toshihiko, et al.
Published: (2026)
by: Nishimura, Toshihiko, et al.
Published: (2026)
Evolving Subnetwork Training for Large Language Models
by: Li, Hanqi, et al.
Published: (2024)
by: Li, Hanqi, et al.
Published: (2024)
Large Language Models for Assisting American College Applications
by: Liu, Zhengliang, et al.
Published: (2026)
by: Liu, Zhengliang, et al.
Published: (2026)
Leveraging Large Language Models for Scalable Vector Graphics-Driven Image Understanding
by: Cai, Mu, et al.
Published: (2023)
by: Cai, Mu, et al.
Published: (2023)
Improving Compiler Bug Isolation by Leveraging Large Language Models
by: Qi, Yixian, et al.
Published: (2025)
by: Qi, Yixian, et al.
Published: (2025)
MVD$^2$: Efficient Multiview 3D Reconstruction for Multiview Diffusion
by: Zheng, Xin-Yang, et al.
Published: (2024)
by: Zheng, Xin-Yang, et al.
Published: (2024)
SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding
by: Jia, Baoxiong, et al.
Published: (2024)
by: Jia, Baoxiong, et al.
Published: (2024)
Opportunities and Challenges of Large Language Models for Low-Resource Languages in Humanities Research
by: Zhong, Tianyang, et al.
Published: (2024)
by: Zhong, Tianyang, et al.
Published: (2024)
Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations
by: Yuan, Zhihao, et al.
Published: (2025)
by: Yuan, Zhihao, et al.
Published: (2025)
DeepCell: Self-Supervised Multiview Fusion for Circuit Representation Learning
by: Shi, Zhengyuan, et al.
Published: (2025)
by: Shi, Zhengyuan, et al.
Published: (2025)
Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding
by: He, Ziyao, et al.
Published: (2026)
by: He, Ziyao, et al.
Published: (2026)
Leveraging Automatic CAD Annotations for Supervised Learning in 3D Scene Understanding
by: Rao, Yuchen, et al.
Published: (2025)
by: Rao, Yuchen, et al.
Published: (2025)
OptArgus: A Multi-Agent System to Detect Hallucinations in LLM-based Optimization Modeling
by: Li, Zhong, et al.
Published: (2026)
by: Li, Zhong, et al.
Published: (2026)
Geometry and Perception Guided Gaussians for Multiview-consistent 3D Generation from a Single Image
by: Li, Pufan, et al.
Published: (2025)
by: Li, Pufan, et al.
Published: (2025)
SceneGPT: A Language Model for 3D Scene Understanding
by: Chandhok, Shivam
Published: (2024)
by: Chandhok, Shivam
Published: (2024)
LangSurf: Language-Embedded Surface Gaussians for 3D Scene Understanding
by: Li, Hao, et al.
Published: (2024)
by: Li, Hao, et al.
Published: (2024)
Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate
by: Paul, Soumava, et al.
Published: (2026)
by: Paul, Soumava, et al.
Published: (2026)
Similar Items
-
3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding
by: Li, Zeju, et al.
Published: (2024) -
Spatial 3D-LLM: Exploring Spatial Awareness in 3D Vision-Language Models
by: Wang, Xiaoyan, et al.
Published: (2025) -
MMGDreamer: Mixed-Modality Graph for Geometry-Controllable 3D Indoor Scene Generation
by: Yang, Zhifei, et al.
Published: (2025) -
Multiview Equivariance Improves 3D Correspondence Understanding with Minimal Feature Finetuning
by: You, Yang, et al.
Published: (2024) -
Multiview Scene Graph
by: Zhang, Juexiao, et al.
Published: (2024)