Comparative Study of Vision-Based Metric Measurement for Large-Scale Planar Scenes
Fuente:
arXiv
Saved in:
| Main Author: | Sun, ZhiXin |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Vision-Based Water Level and Flow Estimation
by: Sun, ZhiXin
Published: (2026)
by: Sun, ZhiXin
Published: (2026)
Example-Based Object Detection
by: Sun, ZhiXin
Published: (2026)
by: Sun, ZhiXin
Published: (2026)
UniEmoX: Cross-modal Semantic-Guided Large-Scale Pretraining for Universal Scene Emotion Perception
by: Chen, Chuang, et al.
Published: (2024)
by: Chen, Chuang, et al.
Published: (2024)
DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D Vision
by: Ling, Lu, et al.
Published: (2023)
by: Ling, Lu, et al.
Published: (2023)
Anomaly Detection Using Computer Vision: A Comparative Analysis of Class Distinction and Performance Metrics
by: Tusher, Md. Barkat Ullah, et al.
Published: (2025)
by: Tusher, Md. Barkat Ullah, et al.
Published: (2025)
How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions
by: An, Na Min, et al.
Published: (2025)
by: An, Na Min, et al.
Published: (2025)
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
by: Yan, Bei, et al.
Published: (2024)
by: Yan, Bei, et al.
Published: (2024)
STAR: A First-Ever Dataset and A Large-Scale Benchmark for Scene Graph Generation in Large-Size Satellite Imagery
by: Li, Yansheng, et al.
Published: (2024)
by: Li, Yansheng, et al.
Published: (2024)
GauU-Scene: A Scene Reconstruction Benchmark on Large Scale 3D Reconstruction Dataset Using Gaussian Splatting
by: Xiong, Butian, et al.
Published: (2024)
by: Xiong, Butian, et al.
Published: (2024)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
by: Zhao, Jianfei, et al.
Published: (2025)
by: Zhao, Jianfei, et al.
Published: (2025)
StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting
by: Simonyan, Aleksandr, et al.
Published: (2026)
by: Simonyan, Aleksandr, et al.
Published: (2026)
SwiftVGGT: A Scalable Visual Geometry Grounded Transformer for Large-Scale Scenes
by: Lee, Jungho, et al.
Published: (2025)
by: Lee, Jungho, et al.
Published: (2025)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
by: Jiang, Siyang, et al.
Published: (2025)
by: Jiang, Siyang, et al.
Published: (2025)
MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources
by: Ma, Baorui, et al.
Published: (2026)
by: Ma, Baorui, et al.
Published: (2026)
Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning
by: Qu, Xiaoye, et al.
Published: (2024)
by: Qu, Xiaoye, et al.
Published: (2024)
GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
by: Huang, Yuanhui, et al.
Published: (2024)
by: Huang, Yuanhui, et al.
Published: (2024)
On the Effectiveness of Methods and Metrics for Explainable AI in Remote Sensing Image Scene Classification
by: Klotz, Jonas, et al.
Published: (2025)
by: Klotz, Jonas, et al.
Published: (2025)
SceneX: Procedural Controllable Large-scale Scene Generation
by: Zhou, Mengqi, et al.
Published: (2024)
by: Zhou, Mengqi, et al.
Published: (2024)
SCube: Instant Large-Scale Scene Reconstruction using VoxSplats
by: Ren, Xuanchi, et al.
Published: (2024)
by: Ren, Xuanchi, et al.
Published: (2024)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
by: Shen, Hengyu, et al.
Published: (2026)
by: Shen, Hengyu, et al.
Published: (2026)
A Causal Adjustment Module for Debiasing Scene Graph Generation
by: Liu, Li, et al.
Published: (2025)
by: Liu, Li, et al.
Published: (2025)
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
by: Zuo, Sicheng, et al.
Published: (2026)
by: Zuo, Sicheng, et al.
Published: (2026)
Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models
by: Li, Nanxi, et al.
Published: (2026)
by: Li, Nanxi, et al.
Published: (2026)
Feature-Optimized Vision for Adaptive 3D Scene Reconstruction
by: Liang, Eric
Published: (2026)
by: Liang, Eric
Published: (2026)
SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments
by: Cao, Yue, et al.
Published: (2024)
by: Cao, Yue, et al.
Published: (2024)
MonoPP: Metric-Scaled Self-Supervised Monocular Depth Estimation by Planar-Parallax Geometry in Automotive Applications
by: Elazab, Gasser, et al.
Published: (2024)
by: Elazab, Gasser, et al.
Published: (2024)
Vision Transformers for Zero-Shot Clustering of Animal Images: A Comparative Benchmarking Study
by: Markoff, Hugo, et al.
Published: (2026)
by: Markoff, Hugo, et al.
Published: (2026)
A Comparative Study of YOLOv8 to YOLOv11 Performance in Underwater Vision Tasks
by: Hung, Gordon, et al.
Published: (2025)
by: Hung, Gordon, et al.
Published: (2025)
Vision-Language Models for Autonomous Driving: CLIP-Based Dynamic Scene Understanding
by: Elhenawy, Mohammed, et al.
Published: (2025)
by: Elhenawy, Mohammed, et al.
Published: (2025)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
by: Zhang, Weichen, et al.
Published: (2025)
by: Zhang, Weichen, et al.
Published: (2025)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
by: Zhang, Xinsong, et al.
Published: (2025)
by: Zhang, Xinsong, et al.
Published: (2025)
INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling
by: Dong, Xin, et al.
Published: (2025)
by: Dong, Xin, et al.
Published: (2025)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
by: Liu, Hanqing, et al.
Published: (2026)
by: Liu, Hanqing, et al.
Published: (2026)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
by: Shi, Xinrui, et al.
Published: (2026)
by: Shi, Xinrui, et al.
Published: (2026)
Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models
by: Wu, Rining, et al.
Published: (2024)
by: Wu, Rining, et al.
Published: (2024)
Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality
by: Cedro, Mateusz, et al.
Published: (2026)
by: Cedro, Mateusz, et al.
Published: (2026)
FurniScene: A Large-scale 3D Room Dataset with Intricate Furnishing Scenes
by: Zhang, Genghao, et al.
Published: (2024)
by: Zhang, Genghao, et al.
Published: (2024)
Vision Bridge Transformer at Scale
by: Tan, Zhenxiong, et al.
Published: (2025)
by: Tan, Zhenxiong, et al.
Published: (2025)
SM4Depth: Seamless Monocular Metric Depth Estimation across Multiple Cameras and Scenes by One Model
by: Liu, Yihao, et al.
Published: (2024)
by: Liu, Yihao, et al.
Published: (2024)
GaRField++: Reinforced Gaussian Radiance Fields for Large-Scale 3D Scene Reconstruction
by: Zhang, Hanyue, et al.
Published: (2024)
by: Zhang, Hanyue, et al.
Published: (2024)
Similar Items
-
Vision-Based Water Level and Flow Estimation
by: Sun, ZhiXin
Published: (2026) -
Example-Based Object Detection
by: Sun, ZhiXin
Published: (2026) -
UniEmoX: Cross-modal Semantic-Guided Large-Scale Pretraining for Universal Scene Emotion Perception
by: Chen, Chuang, et al.
Published: (2024) -
DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D Vision
by: Ling, Lu, et al.
Published: (2023) -
Anomaly Detection Using Computer Vision: A Comparative Analysis of Class Distinction and Performance Metrics
by: Tusher, Md. Barkat Ullah, et al.
Published: (2025)