PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models
Fuente:
arXiv
Saved in:
| Main Authors: | Yokomizo, Hisayuki, Miyanishi, Taiki, Gang, Yan, Kurita, Shuhei, Inoue, Nakamasa, Iwasawa, Yusuke |
|---|---|
| Format: | Preprint |
| Published: |
2026
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
by: Tsuchiya, Fumihiko, et al.
Published: (2026)
by: Tsuchiya, Fumihiko, et al.
Published: (2026)
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
by: Ukai, Mahiro, et al.
Published: (2025)
by: Ukai, Mahiro, et al.
Published: (2025)
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
by: Maeda, Koki, et al.
Published: (2024)
by: Maeda, Koki, et al.
Published: (2024)
GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields
by: Yasuki, Shunsuke, et al.
Published: (2025)
by: Yasuki, Shunsuke, et al.
Published: (2025)
CityNav: A Large-Scale Dataset for Real-World Aerial Navigation
by: Lee, Jungdae, et al.
Published: (2024)
by: Lee, Jungdae, et al.
Published: (2024)
Answerability Fields: Answerable Location Estimation via Diffusion Models
by: Azuma, Daichi, et al.
Published: (2024)
by: Azuma, Daichi, et al.
Published: (2024)
Cross3DVG: Cross-Dataset 3D Visual Grounding on Different RGB-D Scans
by: Miyanishi, Taiki, et al.
Published: (2023)
by: Miyanishi, Taiki, et al.
Published: (2023)
E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes
by: Sakamoto, Koya, et al.
Published: (2026)
by: Sakamoto, Koya, et al.
Published: (2026)
Map-based Modular Approach for Zero-shot Embodied Question Answering
by: Sakamoto, Koya, et al.
Published: (2024)
by: Sakamoto, Koya, et al.
Published: (2024)
Referring Expression Comprehension for Small Objects
by: Goto, Kanoko, et al.
Published: (2025)
by: Goto, Kanoko, et al.
Published: (2025)
AdaCoder: Adaptive Prompt Compression for Programmatic Visual Question Answering
by: Ukai, Mahiro, et al.
Published: (2024)
by: Ukai, Mahiro, et al.
Published: (2024)
ReMoRa: Multimodal Large Language Model based on Refined Motion Representation for Long-Video Understanding
by: Yashima, Daichi, et al.
Published: (2026)
by: Yashima, Daichi, et al.
Published: (2026)
AgroBench: Vision-Language Model Benchmark in Agriculture
by: Shinoda, Risa, et al.
Published: (2025)
by: Shinoda, Risa, et al.
Published: (2025)
JDocQA: Japanese Document Question Answering Dataset for Generative Language Models
by: Onami, Eri, et al.
Published: (2024)
by: Onami, Eri, et al.
Published: (2024)
Multi-modal, Multi-task, Multi-criteria Automatic Evaluation with Vision Language Models
by: Ohi, Masanari, et al.
Published: (2024)
by: Ohi, Masanari, et al.
Published: (2024)
WAON: A Large-Scale Japanese Image-Text Dataset for Cultural Adaptation in Contrastive Vision-Language Models
by: Sugiura, Issa, et al.
Published: (2025)
by: Sugiura, Issa, et al.
Published: (2025)
Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
by: Sasagawa, Keito, et al.
Published: (2025)
by: Sasagawa, Keito, et al.
Published: (2025)
HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers
by: Sugiura, Issa, et al.
Published: (2026)
by: Sugiura, Issa, et al.
Published: (2026)
ABMAMBA: Multimodal Large Language Model with Aligned Hierarchical Bidirectional Scan for Efficient Video Captioning
by: Yashima, Daichi, et al.
Published: (2026)
by: Yashima, Daichi, et al.
Published: (2026)
Stitch4D: Sparse Multi-Location 4D Urban Reconstruction via Spatio-Temporal Interpolation
by: Kogure, Hina, et al.
Published: (2026)
by: Kogure, Hina, et al.
Published: (2026)
Generating 6DoF Object Manipulation Trajectories from Action Description in Egocentric Vision
by: Yoshida, Tomoya, et al.
Published: (2025)
by: Yoshida, Tomoya, et al.
Published: (2025)
DF-Mamba: Deformable State Space Modeling for 3D Hand Pose Estimation in Interactions
by: Zhou, Yifan, et al.
Published: (2025)
by: Zhou, Yifan, et al.
Published: (2025)
LegalViz: Legal Text Visualization by Text To Diagram Generation
by: Onami, Eri, et al.
Published: (2025)
by: Onami, Eri, et al.
Published: (2025)
Text-driven Affordance Learning from Egocentric Vision
by: Yoshida, Tomoya, et al.
Published: (2024)
by: Yoshida, Tomoya, et al.
Published: (2024)
Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models
by: Sugiura, Issa, et al.
Published: (2026)
by: Sugiura, Issa, et al.
Published: (2026)
Pyramid Coder: Hierarchical Code Generator for Compositional Visual Question Answering
by: Shen, Ruoyue, et al.
Published: (2024)
by: Shen, Ruoyue, et al.
Published: (2024)
From Correspondence to Actions: Human-Like Multi-Image Spatial Reasoning in Multi-modal Large Language Models
by: Oi, Masanari, et al.
Published: (2026)
by: Oi, Masanari, et al.
Published: (2026)
Unlocking Noise-Resistant Vision: Key Architectural Secrets for Robust Models
by: Kim, Bum Jun, et al.
Published: (2025)
by: Kim, Bum Jun, et al.
Published: (2025)
JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation
by: Sugiura, Issa, et al.
Published: (2026)
by: Sugiura, Issa, et al.
Published: (2026)
On the Use of Hierarchical Vision Foundation Models for Low-Cost Human Mesh Recovery and Pose Estimation
by: Tarashima, Shuhei, et al.
Published: (2025)
by: Tarashima, Shuhei, et al.
Published: (2025)
BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment
by: Shinoda, Risa, et al.
Published: (2026)
by: Shinoda, Risa, et al.
Published: (2026)
AnimalClue: Recognizing Animals by their Traces
by: Shinoda, Risa, et al.
Published: (2025)
by: Shinoda, Risa, et al.
Published: (2025)
PowerCLIP: Powerset Alignment for Contrastive Pre-Training
by: Kawamura, Masaki, et al.
Published: (2025)
by: Kawamura, Masaki, et al.
Published: (2025)
DISCODE: Distribution-Aware Score Decoder for Robust Automatic Evaluation of Image Captioning
by: Inoue, Nakamasa, et al.
Published: (2025)
by: Inoue, Nakamasa, et al.
Published: (2025)
CLIP-like Model as a Foundational Density Ratio Estimator
by: Uchiyama, Fumiya, et al.
Published: (2025)
by: Uchiyama, Fumiya, et al.
Published: (2025)
ViLAaD: Enhancing "Attracting and Dispersing'' Source-Free Domain Adaptation with Vision-and-Language Model
by: Tarashima, Shuhei, et al.
Published: (2025)
by: Tarashima, Shuhei, et al.
Published: (2025)
Multi-Point Positional Insertion Tuning for Small Object Detection
by: Goto, Kanoko, et al.
Published: (2024)
by: Goto, Kanoko, et al.
Published: (2024)
Frequency-Calibrated Membership Inference Attacks on Medical Image Diffusion Models
by: Zhao, Xinkai, et al.
Published: (2025)
by: Zhao, Xinkai, et al.
Published: (2025)
Quant Experts: Token-aware Adaptive Error Reconstruction with Mixture of Experts for Large Vision-Language Models Quantization
by: Jia, Chenwei, et al.
Published: (2026)
by: Jia, Chenwei, et al.
Published: (2026)
SlideAVSR: A Dataset of Paper Explanation Videos for Audio-Visual Speech Recognition
by: Wang, Hao, et al.
Published: (2024)
by: Wang, Hao, et al.
Published: (2024)
Similar Items
-
EC-Bench: Enumeration and Counting Benchmark for Ultra-Long Videos
by: Tsuchiya, Fumihiko, et al.
Published: (2026) -
STATUS Bench: A Rigorous Benchmark for Evaluating Object State Understanding in Vision-Language Models
by: Ukai, Mahiro, et al.
Published: (2025) -
Vision Language Model-based Caption Evaluation Method Leveraging Visual Context Extraction
by: Maeda, Koki, et al.
Published: (2024) -
GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields
by: Yasuki, Shunsuke, et al.
Published: (2025) -
CityNav: A Large-Scale Dataset for Real-World Aerial Navigation
by: Lee, Jungdae, et al.
Published: (2024)