Not Your Stereo-Typical Estimator: Combining Vision and Language for Volume Perception
Fuente:
arXiv
Salvato in:
| Autori principali: | Vinod, Gautham, Coburn, Bruce, Raghavan, Siddeshwar, Zhu, Fengqing |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2026
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
DietDelta: A Vision-Language Approach for Dietary Assessment via Before-and-After Images
di: Vinod, Gautham, et al.
Pubblicazione: (2026)
di: Vinod, Gautham, et al.
Pubblicazione: (2026)
Food Portion Estimation: From Pixels to Calories
di: Vinod, Gautham, et al.
Pubblicazione: (2026)
di: Vinod, Gautham, et al.
Pubblicazione: (2026)
Size Matters: Reconstructing Real-Scale 3D Models from Monocular Images for Food Portion Estimation
di: Vinod, Gautham, et al.
Pubblicazione: (2026)
di: Vinod, Gautham, et al.
Pubblicazione: (2026)
Food Portion Estimation via 3D Object Scaling
di: Vinod, Gautham, et al.
Pubblicazione: (2024)
di: Vinod, Gautham, et al.
Pubblicazione: (2024)
MFP3D: Monocular Food Portion Estimation Leveraging 3D Point Clouds
di: Ma, Jinge, et al.
Pubblicazione: (2024)
di: Ma, Jinge, et al.
Pubblicazione: (2024)
PANDA -- Patch And Distribution-Aware Augmentation for Long-Tailed Exemplar-Free Continual Learning
di: Raghavan, Siddeshwar, et al.
Pubblicazione: (2025)
di: Raghavan, Siddeshwar, et al.
Pubblicazione: (2025)
Can You Hear, Localize, and Segment Continually? An Exemplar-Free Continual Learning Benchmark for Audio-Visual Segmentation
di: Raghavan, Siddeshwar, et al.
Pubblicazione: (2026)
di: Raghavan, Siddeshwar, et al.
Pubblicazione: (2026)
CAMSIC: Content-aware Masked Image Modeling Transformer for Stereo Image Compression
di: Zhang, Xinjie, et al.
Pubblicazione: (2024)
di: Zhang, Xinjie, et al.
Pubblicazione: (2024)
Machine Perception-Driven Image Compression: A Layered Generative Approach
di: Zhang, Yuefeng, et al.
Pubblicazione: (2023)
di: Zhang, Yuefeng, et al.
Pubblicazione: (2023)
From Darkness to Detail: Frequency-Aware SSMs for Low-Light Vision
di: Adhikarla, Eashan, et al.
Pubblicazione: (2024)
di: Adhikarla, Eashan, et al.
Pubblicazione: (2024)
Optimal Transcoding Resolution Prediction for Efficient Per-Title Bitrate Ladder Estimation
di: Yang, Jinhai, et al.
Pubblicazione: (2024)
di: Yang, Jinhai, et al.
Pubblicazione: (2024)
CAMP-VQA: Caption-Embedded Multimodal Perception for No-Reference Quality Assessment of Compressed Video
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
di: Wang, Xinyi, et al.
Pubblicazione: (2025)
Off-the-shelf Vision Models Benefit Image Manipulation Localization
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2026)
di: Zhang, Zhengxuan, et al.
Pubblicazione: (2026)
Towards Point Cloud Compression for Machine Perception: A Simple and Strong Baseline by Learning the Octree Depth Level Predictor
di: Liu, Lei, et al.
Pubblicazione: (2024)
di: Liu, Lei, et al.
Pubblicazione: (2024)
A Near-Raw Talking-Head Video Dataset for Various Computer Vision Tasks
di: Naderi, Babak, et al.
Pubblicazione: (2026)
di: Naderi, Babak, et al.
Pubblicazione: (2026)
Sphere-GAN: a GAN-based Approach for Saliency Estimation in 360° Videos
di: Wahba, Mahmoud Z. A., et al.
Pubblicazione: (2025)
di: Wahba, Mahmoud Z. A., et al.
Pubblicazione: (2025)
E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes
di: Zhai, Jiajun, et al.
Pubblicazione: (2026)
di: Zhai, Jiajun, et al.
Pubblicazione: (2026)
Context and Pixel Aware Large Language Model for Video Quality Assessment
di: Wen, Wen, et al.
Pubblicazione: (2025)
di: Wen, Wen, et al.
Pubblicazione: (2025)
Exploiting Frequency Correlation for Hyperspectral Image Reconstruction
di: Yan, Muge, et al.
Pubblicazione: (2024)
di: Yan, Muge, et al.
Pubblicazione: (2024)
Inter-Frame Compression for Dynamic Point Cloud Geometry Coding
di: Akhtar, Anique, et al.
Pubblicazione: (2022)
di: Akhtar, Anique, et al.
Pubblicazione: (2022)
MSNeRV: Neural Video Representation with Multi-Scale Feature Fusion
di: Zhu, Jun, et al.
Pubblicazione: (2025)
di: Zhu, Jun, et al.
Pubblicazione: (2025)
Surveillance Facial Image Quality Assessment: A Multi-dimensional Dataset and Lightweight Model
di: Jiang, Yanwei, et al.
Pubblicazione: (2026)
di: Jiang, Yanwei, et al.
Pubblicazione: (2026)
HiDE: Hierarchical Dictionary-Based Entropy Modeling for Learned Image Compression
di: Xiong, Haoxuan, et al.
Pubblicazione: (2026)
di: Xiong, Haoxuan, et al.
Pubblicazione: (2026)
Perceptual Video Quality Assessment: A Survey
di: Min, Xiongkuo, et al.
Pubblicazione: (2024)
di: Min, Xiongkuo, et al.
Pubblicazione: (2024)
Stereo Sound Event Localization and Detection with Onscreen/offscreen Classification
di: Shimada, Kazuki, et al.
Pubblicazione: (2025)
di: Shimada, Kazuki, et al.
Pubblicazione: (2025)
A Dynamic Prognostic Prediction Method for Colorectal Cancer Liver Metastasis
di: Yang, Wei, et al.
Pubblicazione: (2025)
di: Yang, Wei, et al.
Pubblicazione: (2025)
ML-CLIPSim: Multi-Layer CLIP Similarity for Machine-Oriented Image Quality
di: Ding, Feng, et al.
Pubblicazione: (2026)
di: Ding, Feng, et al.
Pubblicazione: (2026)
Enhanced Radar Perception via Multi-Task Learning: Towards Refined Data for Sensor Fusion Applications
di: Sun, Huawei, et al.
Pubblicazione: (2024)
di: Sun, Huawei, et al.
Pubblicazione: (2024)
Towards Real-world Video Face Restoration: A New Benchmark
di: Chen, Ziyan, et al.
Pubblicazione: (2024)
di: Chen, Ziyan, et al.
Pubblicazione: (2024)
EVAN: Evolutional Video Streaming Adaptation via Neural Representation
di: Liu, Mufan, et al.
Pubblicazione: (2024)
di: Liu, Mufan, et al.
Pubblicazione: (2024)
Change Detection Between Optical Remote Sensing Imagery and Map Data via Segment Anything Model (SAM)
di: Chen, Hongruixuan, et al.
Pubblicazione: (2024)
di: Chen, Hongruixuan, et al.
Pubblicazione: (2024)
SurFITR: A Dataset for Surveillance Image Forgery Detection and Localisation
di: Wang, Qizhou, et al.
Pubblicazione: (2026)
di: Wang, Qizhou, et al.
Pubblicazione: (2026)
Visual and Text Prompt Segmentation: A Novel Multi-Model Framework for Remote Sensing
di: Zi, Xing, et al.
Pubblicazione: (2025)
di: Zi, Xing, et al.
Pubblicazione: (2025)
Towards Blind Bitstream-corrupted Video Recovery via a Visual Foundation Model-driven Framework
di: Liu, Tianyi, et al.
Pubblicazione: (2025)
di: Liu, Tianyi, et al.
Pubblicazione: (2025)
PixelBoost: Leveraging Brownian Motion for Realistic-Image Super-Resolution
di: Mishra, Aradhana, et al.
Pubblicazione: (2025)
di: Mishra, Aradhana, et al.
Pubblicazione: (2025)
RAISE: Realness Assessment for Image Synthesis and Evaluation
di: Mukherjee, Aniruddha, et al.
Pubblicazione: (2025)
di: Mukherjee, Aniruddha, et al.
Pubblicazione: (2025)
VineetVC: Adaptive Video Conferencing Under Severe Bandwidth Constraints Using Audio-Driven Talking-Head Reconstruction
di: Rakesh, Vineet Kumar, et al.
Pubblicazione: (2026)
di: Rakesh, Vineet Kumar, et al.
Pubblicazione: (2026)
Movie Trailer Genre Classification Using Multimodal Pretrained Features
di: Sulun, Serkan, et al.
Pubblicazione: (2024)
di: Sulun, Serkan, et al.
Pubblicazione: (2024)
GaussianImage: 1000 FPS Image Representation and Compression by 2D Gaussian Splatting
di: Zhang, Xinjie, et al.
Pubblicazione: (2024)
di: Zhang, Xinjie, et al.
Pubblicazione: (2024)
AIM 2024 Challenge on Compressed Video Quality Assessment: Methods and Results
di: Smirnov, Maksim, et al.
Pubblicazione: (2024)
di: Smirnov, Maksim, et al.
Pubblicazione: (2024)
Documenti analoghi
-
DietDelta: A Vision-Language Approach for Dietary Assessment via Before-and-After Images
di: Vinod, Gautham, et al.
Pubblicazione: (2026) -
Food Portion Estimation: From Pixels to Calories
di: Vinod, Gautham, et al.
Pubblicazione: (2026) -
Size Matters: Reconstructing Real-Scale 3D Models from Monocular Images for Food Portion Estimation
di: Vinod, Gautham, et al.
Pubblicazione: (2026) -
Food Portion Estimation via 3D Object Scaling
di: Vinod, Gautham, et al.
Pubblicazione: (2024) -
MFP3D: Monocular Food Portion Estimation Leveraging 3D Point Clouds
di: Ma, Jinge, et al.
Pubblicazione: (2024)