Real-Time Fusion of Visual and Chart Data for Enhanced Maritime Vision
Fuente:
arXiv
Guardado en:
| Autores principales: | Kreis, Marten, Kiefer, Benjamin |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
3rd Workshop on Maritime Computer Vision (MaCVi) 2025: Challenge Results
por: Kiefer, Benjamin, et al.
Publicado: (2025)
por: Kiefer, Benjamin, et al.
Publicado: (2025)
Generating Synthetic Data via Augmentations for Improved Facial Resemblance in DreamBooth and InstantID
por: Ulusan, Koray, et al.
Publicado: (2025)
por: Ulusan, Koray, et al.
Publicado: (2025)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
por: Huang, Kung-Hsiang, et al.
Publicado: (2025)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
por: She, Yifei, et al.
Publicado: (2025)
por: She, Yifei, et al.
Publicado: (2025)
ChartGemma: Visual Instruction-tuning for Chart Reasoning in the Wild
por: Masry, Ahmed, et al.
Publicado: (2024)
por: Masry, Ahmed, et al.
Publicado: (2024)
Real-time Ship Recognition and Georeferencing for the Improvement of Maritime Situational Awareness
por: Perez, Borja Carrillo
Publicado: (2024)
por: Perez, Borja Carrillo
Publicado: (2024)
Arbitrary Data as Images: Fusion of Patient Data Across Modalities and Irregular Intervals with Vision Transformers
por: Tölle, Malte, et al.
Publicado: (2025)
por: Tölle, Malte, et al.
Publicado: (2025)
4th Workshop on Maritime Computer Vision (MaCVi): Challenge Overview
por: Kiefer, Benjamin, et al.
Publicado: (2026)
por: Kiefer, Benjamin, et al.
Publicado: (2026)
Approximate Supervised Object Distance Estimation on Unmanned Surface Vehicles
por: Kiefer, Benjamin, et al.
Publicado: (2025)
por: Kiefer, Benjamin, et al.
Publicado: (2025)
mChartQA: A universal benchmark for multimodal Chart Question Answer based on Vision-Language Alignment and Reasoning
por: Wei, Jingxuan, et al.
Publicado: (2024)
por: Wei, Jingxuan, et al.
Publicado: (2024)
Fusion of Pervasive RF Data with Spatial Images via Vision Transformers for Enhanced Mapping in Smart Cities
por: Mkrtchyan, Rafayel, et al.
Publicado: (2025)
por: Mkrtchyan, Rafayel, et al.
Publicado: (2025)
Florence-VL: Enhancing Vision-Language Models with Generative Vision Encoder and Depth-Breadth Fusion
por: Chen, Jiuhai, et al.
Publicado: (2024)
por: Chen, Jiuhai, et al.
Publicado: (2024)
Real-Time Visual Attribution Streaming in Thinking Model
por: Kang, Seil, et al.
Publicado: (2026)
por: Kang, Seil, et al.
Publicado: (2026)
ChartHal: A Fine-grained Framework Evaluating Hallucination of Large Vision Language Models in Chart Understanding
por: Wang, Xingqi, et al.
Publicado: (2025)
por: Wang, Xingqi, et al.
Publicado: (2025)
ChartM$^3$: Benchmarking Chart Editing with Multimodal Instructions
por: Yang, Donglu, et al.
Publicado: (2025)
por: Yang, Donglu, et al.
Publicado: (2025)
AskChart: Universal Chart Understanding through Textual Enhancement
por: Yang, Xudong, et al.
Publicado: (2024)
por: Yang, Xudong, et al.
Publicado: (2024)
Visual Chart Representations for Cryptocurrency Regime Prediction: A Systematic Deep Learning Study
por: Haggett, Dustin M.
Publicado: (2026)
por: Haggett, Dustin M.
Publicado: (2026)
Chart-FR1: Visual Focus-Driven Fine-Grained Reasoning on Dense Charts
por: Pan, Hongkun, et al.
Publicado: (2026)
por: Pan, Hongkun, et al.
Publicado: (2026)
When Visuals Aren't the Problem: Evaluating Vision-Language Models on Misleading Data Visualizations
por: Lalai, Harsh Nishant, et al.
Publicado: (2026)
por: Lalai, Harsh Nishant, et al.
Publicado: (2026)
Attend-Fusion: Efficient Audio-Visual Fusion for Video Classification
por: Awan, Mahrukh, et al.
Publicado: (2024)
por: Awan, Mahrukh, et al.
Publicado: (2024)
Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning
por: Zeng, Xingchen, et al.
Publicado: (2024)
por: Zeng, Xingchen, et al.
Publicado: (2024)
InfoChartQA: A Benchmark for Multimodal Question Answering on Infographic Charts
por: Xie, Tianchi, et al.
Publicado: (2025)
por: Xie, Tianchi, et al.
Publicado: (2025)
Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner
por: Chen, Lei, et al.
Publicado: (2025)
por: Chen, Lei, et al.
Publicado: (2025)
Leveraging Vision-Language Models for Visual Grounding and Analysis of Automotive UI
por: Ernhofer, Benjamin Raphael, et al.
Publicado: (2025)
por: Ernhofer, Benjamin Raphael, et al.
Publicado: (2025)
EVM-Fusion: An Explainable Vision Mamba Architecture with Neural Algorithmic Fusion
por: Yang, Zichuan, et al.
Publicado: (2025)
por: Yang, Zichuan, et al.
Publicado: (2025)
SIMPLOT: Enhancing Chart Question Answering by Distilling Essentials
por: Kim, Wonjoong, et al.
Publicado: (2024)
por: Kim, Wonjoong, et al.
Publicado: (2024)
Feedback Driven Multi Stereo Vision System for Real-Time Event Analysis
por: Benkedadra, Mohamed, et al.
Publicado: (2025)
por: Benkedadra, Mohamed, et al.
Publicado: (2025)
Attention-Based Real-Time Defenses for Physical Adversarial Attacks in Vision Applications
por: Rossolini, Giulio, et al.
Publicado: (2023)
por: Rossolini, Giulio, et al.
Publicado: (2023)
RadarSeq: A Temporal Vision Framework for User Churn Prediction via Radar Chart Sequences
por: Najafi, Sina, et al.
Publicado: (2025)
por: Najafi, Sina, et al.
Publicado: (2025)
Synthetic-to-Real Domain Bridging for Single-View 3D Reconstruction of Ships for Maritime Monitoring
por: Carrillo-Perez, Borja, et al.
Publicado: (2026)
por: Carrillo-Perez, Borja, et al.
Publicado: (2026)
DisCo-Diff: Enhancing Continuous Diffusion Models with Discrete Latents
por: Xu, Yilun, et al.
Publicado: (2024)
por: Xu, Yilun, et al.
Publicado: (2024)
Xray-Visual Models: Scaling Vision models on Industry Scale Data
por: Mishra, Shlok, et al.
Publicado: (2026)
por: Mishra, Shlok, et al.
Publicado: (2026)
DART: Depth-Enhanced Accurate and Real-Time Background Matting
por: Li, Hanxi, et al.
Publicado: (2024)
por: Li, Hanxi, et al.
Publicado: (2024)
CHARTOM: A Visual Theory-of-Mind Benchmark for LLMs on Misleading Charts
por: Bharti, Shubham, et al.
Publicado: (2024)
por: Bharti, Shubham, et al.
Publicado: (2024)
Process Integrated Computer Vision for Real-Time Failure Prediction in Steel Rolling Mill
por: Kurrey, Vaibhav, et al.
Publicado: (2025)
por: Kurrey, Vaibhav, et al.
Publicado: (2025)
Temporally-Grounded Language Generation: A Benchmark for Real-Time Vision-Language Models
por: Yu, Keunwoo Peter, et al.
Publicado: (2025)
por: Yu, Keunwoo Peter, et al.
Publicado: (2025)
ChartCap: Mitigating Hallucination of Dense Chart Captioning
por: Lim, Junyoung, et al.
Publicado: (2025)
por: Lim, Junyoung, et al.
Publicado: (2025)
Real-Time Weapon Detection Using YOLOv8 for Enhanced Safety
por: Thakur, Ayush, et al.
Publicado: (2024)
por: Thakur, Ayush, et al.
Publicado: (2024)
GreenEye: Development of Real-Time Traffic Signal Recognition System for Visual Impairments
por: Kim, Danu
Publicado: (2024)
por: Kim, Danu
Publicado: (2024)
Adding Thermal Awareness to Visual Systems in Real-Time via Distilled Diffusion Models
por: Guo, Yuchen, et al.
Publicado: (2026)
por: Guo, Yuchen, et al.
Publicado: (2026)
Ejemplares similares
-
3rd Workshop on Maritime Computer Vision (MaCVi) 2025: Challenge Results
por: Kiefer, Benjamin, et al.
Publicado: (2025) -
Generating Synthetic Data via Augmentations for Improved Facial Resemblance in DreamBooth and InstantID
por: Ulusan, Koray, et al.
Publicado: (2025) -
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
por: Huang, Kung-Hsiang, et al.
Publicado: (2025) -
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
por: She, Yifei, et al.
Publicado: (2025) -
ChartGemma: Visual Instruction-tuning for Chart Reasoning in the Wild
por: Masry, Ahmed, et al.
Publicado: (2024)