Comparative Study of Vision-Based Metric Measurement for Large-Scale Planar Scenes
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Sun, ZhiXin |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Vision-Based Water Level and Flow Estimation
par: Sun, ZhiXin
Publié: (2026)
par: Sun, ZhiXin
Publié: (2026)
Example-Based Object Detection
par: Sun, ZhiXin
Publié: (2026)
par: Sun, ZhiXin
Publié: (2026)
UniEmoX: Cross-modal Semantic-Guided Large-Scale Pretraining for Universal Scene Emotion Perception
par: Chen, Chuang, et autres
Publié: (2024)
par: Chen, Chuang, et autres
Publié: (2024)
DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D Vision
par: Ling, Lu, et autres
Publié: (2023)
par: Ling, Lu, et autres
Publié: (2023)
Anomaly Detection Using Computer Vision: A Comparative Analysis of Class Distinction and Performance Metrics
par: Tusher, Md. Barkat Ullah, et autres
Publié: (2025)
par: Tusher, Md. Barkat Ullah, et autres
Publié: (2025)
How Blind and Low-Vision Individuals Prefer Large Vision-Language Model-Generated Scene Descriptions
par: An, Na Min, et autres
Publié: (2025)
par: An, Na Min, et autres
Publié: (2025)
Measuring the Measurers: Quality Evaluation of Hallucination Benchmarks for Large Vision-Language Models
par: Yan, Bei, et autres
Publié: (2024)
par: Yan, Bei, et autres
Publié: (2024)
STAR: A First-Ever Dataset and A Large-Scale Benchmark for Scene Graph Generation in Large-Size Satellite Imagery
par: Li, Yansheng, et autres
Publié: (2024)
par: Li, Yansheng, et autres
Publié: (2024)
GauU-Scene: A Scene Reconstruction Benchmark on Large Scale 3D Reconstruction Dataset Using Gaussian Splatting
par: Xiong, Butian, et autres
Publié: (2024)
par: Xiong, Butian, et autres
Publié: (2024)
Cross-Layer Vision Smoothing: Enhancing Visual Understanding via Sustained Focus on Key Objects in Large Vision-Language Models
par: Zhao, Jianfei, et autres
Publié: (2025)
par: Zhao, Jianfei, et autres
Publié: (2025)
StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting
par: Simonyan, Aleksandr, et autres
Publié: (2026)
par: Simonyan, Aleksandr, et autres
Publié: (2026)
SwiftVGGT: A Scalable Visual Geometry Grounded Transformer for Large-Scale Scenes
par: Lee, Jungho, et autres
Publié: (2025)
par: Lee, Jungho, et autres
Publié: (2025)
A Large-Scale Multimodal Dataset and Benchmarks for Human Activity Scene Understanding and Reasoning
par: Jiang, Siyang, et autres
Publié: (2025)
par: Jiang, Siyang, et autres
Publié: (2025)
MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources
par: Ma, Baorui, et autres
Publié: (2026)
par: Ma, Baorui, et autres
Publié: (2026)
Look, Compare, Decide: Alleviating Hallucination in Large Vision-Language Models via Multi-View Multi-Path Reasoning
par: Qu, Xiaoye, et autres
Publié: (2024)
par: Qu, Xiaoye, et autres
Publié: (2024)
GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction
par: Huang, Yuanhui, et autres
Publié: (2024)
par: Huang, Yuanhui, et autres
Publié: (2024)
On the Effectiveness of Methods and Metrics for Explainable AI in Remote Sensing Image Scene Classification
par: Klotz, Jonas, et autres
Publié: (2025)
par: Klotz, Jonas, et autres
Publié: (2025)
SceneX: Procedural Controllable Large-scale Scene Generation
par: Zhou, Mengqi, et autres
Publié: (2024)
par: Zhou, Mengqi, et autres
Publié: (2024)
SCube: Instant Large-Scale Scene Reconstruction using VoxSplats
par: Ren, Xuanchi, et autres
Publié: (2024)
par: Ren, Xuanchi, et autres
Publié: (2024)
DanQing: An Up-to-Date Large-Scale Chinese Vision-Language Pre-training Dataset
par: Shen, Hengyu, et autres
Publié: (2026)
par: Shen, Hengyu, et autres
Publié: (2026)
A Causal Adjustment Module for Debiasing Scene Graph Generation
par: Liu, Li, et autres
Publié: (2025)
par: Liu, Li, et autres
Publié: (2025)
DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale
par: Zuo, Sicheng, et autres
Publié: (2026)
par: Zuo, Sicheng, et autres
Publié: (2026)
Beyond Static Vision: Scene Dynamic Field Unlocks Intuitive Physics Understanding in Multi-modal Large Language Models
par: Li, Nanxi, et autres
Publié: (2026)
par: Li, Nanxi, et autres
Publié: (2026)
Feature-Optimized Vision for Adaptive 3D Scene Reconstruction
par: Liang, Eric
Publié: (2026)
par: Liang, Eric
Publié: (2026)
SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments
par: Cao, Yue, et autres
Publié: (2024)
par: Cao, Yue, et autres
Publié: (2024)
MonoPP: Metric-Scaled Self-Supervised Monocular Depth Estimation by Planar-Parallax Geometry in Automotive Applications
par: Elazab, Gasser, et autres
Publié: (2024)
par: Elazab, Gasser, et autres
Publié: (2024)
Vision Transformers for Zero-Shot Clustering of Animal Images: A Comparative Benchmarking Study
par: Markoff, Hugo, et autres
Publié: (2026)
par: Markoff, Hugo, et autres
Publié: (2026)
A Comparative Study of YOLOv8 to YOLOv11 Performance in Underwater Vision Tasks
par: Hung, Gordon, et autres
Publié: (2025)
par: Hung, Gordon, et autres
Publié: (2025)
Vision-Language Models for Autonomous Driving: CLIP-Based Dynamic Scene Understanding
par: Elhenawy, Mohammed, et autres
Publié: (2025)
par: Elhenawy, Mohammed, et autres
Publié: (2025)
The Point, the Vision and the Text: Does Point Cloud Boost Spatial Reasoning of Large Language Models? A Bias-Controlled Study
par: Zhang, Weichen, et autres
Publié: (2025)
par: Zhang, Weichen, et autres
Publié: (2025)
Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training
par: Zhang, Xinsong, et autres
Publié: (2025)
par: Zhang, Xinsong, et autres
Publié: (2025)
INTER: Mitigating Hallucination in Large Vision-Language Models by Interaction Guidance Sampling
par: Dong, Xin, et autres
Publié: (2025)
par: Dong, Xin, et autres
Publié: (2025)
RE-VLM: Event-Augmented Vision-Language Model for Scene Understanding
par: Liu, Hanqing, et autres
Publié: (2026)
par: Liu, Hanqing, et autres
Publié: (2026)
DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models
par: Shi, Xinrui, et autres
Publié: (2026)
par: Shi, Xinrui, et autres
Publié: (2026)
Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models
par: Wu, Rining, et autres
Publié: (2024)
par: Wu, Rining, et autres
Publié: (2024)
Scaling Vision Models Does Not Consistently Improve Localisation-Based Explanation Quality
par: Cedro, Mateusz, et autres
Publié: (2026)
par: Cedro, Mateusz, et autres
Publié: (2026)
FurniScene: A Large-scale 3D Room Dataset with Intricate Furnishing Scenes
par: Zhang, Genghao, et autres
Publié: (2024)
par: Zhang, Genghao, et autres
Publié: (2024)
Vision Bridge Transformer at Scale
par: Tan, Zhenxiong, et autres
Publié: (2025)
par: Tan, Zhenxiong, et autres
Publié: (2025)
SM4Depth: Seamless Monocular Metric Depth Estimation across Multiple Cameras and Scenes by One Model
par: Liu, Yihao, et autres
Publié: (2024)
par: Liu, Yihao, et autres
Publié: (2024)
GaRField++: Reinforced Gaussian Radiance Fields for Large-Scale 3D Scene Reconstruction
par: Zhang, Hanyue, et autres
Publié: (2024)
par: Zhang, Hanyue, et autres
Publié: (2024)
Documents similaires
-
Vision-Based Water Level and Flow Estimation
par: Sun, ZhiXin
Publié: (2026) -
Example-Based Object Detection
par: Sun, ZhiXin
Publié: (2026) -
UniEmoX: Cross-modal Semantic-Guided Large-Scale Pretraining for Universal Scene Emotion Perception
par: Chen, Chuang, et autres
Publié: (2024) -
DL3DV-10K: A Large-Scale Scene Dataset for Deep Learning-based 3D Vision
par: Ling, Lu, et autres
Publié: (2023) -
Anomaly Detection Using Computer Vision: A Comparative Analysis of Class Distinction and Performance Metrics
par: Tusher, Md. Barkat Ullah, et autres
Publié: (2025)