From Vision To Language through Graph of Events in Space and Time: An Explainable Self-supervised Approach
Fuente:
arXiv
Salvato in:
| Autori principali: | Masala, Mihai, Leordeanu, Marius |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Towards Zero-Shot & Explainable Video Description by Reasoning over Graphs of Events in Space and Time
di: Masala, Mihai, et al.
Pubblicazione: (2025)
di: Masala, Mihai, et al.
Pubblicazione: (2025)
Agentic Video Generation: From Text to Executable Event Graphs via Tool-Constrained LLM Planning
di: Cudlenco, Nicolae, et al.
Pubblicazione: (2026)
di: Cudlenco, Nicolae, et al.
Pubblicazione: (2026)
GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models
di: Cudlenco, Nicolae, et al.
Pubblicazione: (2026)
di: Cudlenco, Nicolae, et al.
Pubblicazione: (2026)
Inside Knowledge: Graph-based Path Generation with Explainable Data Augmentation and Curriculum Learning for Visual Indoor Navigation
di: Airinei, Daniel, et al.
Pubblicazione: (2025)
di: Airinei, Daniel, et al.
Pubblicazione: (2025)
Probabilistic Hyper-Graphs using Multiple Randomly Masked Autoencoders for Semi-supervised Multi-modal Multi-task Learning
di: Mihai-Cristian, Pîrvu, et al.
Pubblicazione: (2025)
di: Mihai-Cristian, Pîrvu, et al.
Pubblicazione: (2025)
Multi-modal video data-pipelines for machine learning with minimal human supervision
di: Pîrvu, Mihai-Cristian, et al.
Pubblicazione: (2025)
di: Pîrvu, Mihai-Cristian, et al.
Pubblicazione: (2025)
Uni-Mlip: Unified Self-supervision for Medical Vision Language Pre-training
di: Bawazir, Ameera, et al.
Pubblicazione: (2024)
di: Bawazir, Ameera, et al.
Pubblicazione: (2024)
"Înţelegi Româneşte?'' A Recipe for Romanian Vision-Language Models
di: Masala, Mihai, et al.
Pubblicazione: (2026)
di: Masala, Mihai, et al.
Pubblicazione: (2026)
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
di: Qu, Kevin, et al.
Pubblicazione: (2026)
di: Qu, Kevin, et al.
Pubblicazione: (2026)
Learning from Random Subspace Exploration: Generalized Test-Time Augmentation with Self-supervised Distillation
di: Jelea, Andrei, et al.
Pubblicazione: (2025)
di: Jelea, Andrei, et al.
Pubblicazione: (2025)
SleepVLM: Explainable and Rule-Grounded Sleep Staging via a Vision-Language Model
di: Deng, Guifeng, et al.
Pubblicazione: (2026)
di: Deng, Guifeng, et al.
Pubblicazione: (2026)
Non-verbal Real-time Human-AI Interaction in Constrained Robotic Environments
di: Costea, Dragos, et al.
Pubblicazione: (2026)
di: Costea, Dragos, et al.
Pubblicazione: (2026)
CBVLM: Training-free Explainable Concept-based Large Vision Language Models for Medical Image Classification
di: Patrício, Cristiano, et al.
Pubblicazione: (2025)
di: Patrício, Cristiano, et al.
Pubblicazione: (2025)
Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
di: Deng, Ken, et al.
Pubblicazione: (2026)
di: Deng, Ken, et al.
Pubblicazione: (2026)
Understanding Figurative Meaning through Explainable Visual Entailment
di: Saakyan, Arkadiy, et al.
Pubblicazione: (2024)
di: Saakyan, Arkadiy, et al.
Pubblicazione: (2024)
Explore and Explain: Self-supervised Navigation and Recounting
di: Bigazzi, Roberto, et al.
Pubblicazione: (2020)
di: Bigazzi, Roberto, et al.
Pubblicazione: (2020)
Explainable Synthetic Image Detection through Diffusion Timestep Ensembling
di: Wu, Yixin, et al.
Pubblicazione: (2025)
di: Wu, Yixin, et al.
Pubblicazione: (2025)
ViPER: Empowering the Self-Evolution of Visual Perception Abilities in Vision-Language Model
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
Talking to DINO: Bridging Self-Supervised Vision Backbones with Language for Open-Vocabulary Segmentation
di: Barsellotti, Luca, et al.
Pubblicazione: (2024)
di: Barsellotti, Luca, et al.
Pubblicazione: (2024)
ESTR-CoT: Towards Explainable and Accurate Event Stream based Scene Text Recognition with Chain-of-Thought Reasoning
di: Wang, Xiao, et al.
Pubblicazione: (2025)
di: Wang, Xiao, et al.
Pubblicazione: (2025)
From Local Concepts to Universals: Evaluating the Multicultural Understanding of Vision-Language Models
di: Bhatia, Mehar, et al.
Pubblicazione: (2024)
di: Bhatia, Mehar, et al.
Pubblicazione: (2024)
CorNav: Autonomous Agent with Self-Corrected Planning for Zero-Shot Vision-and-Language Navigation
di: Liang, Xiwen, et al.
Pubblicazione: (2023)
di: Liang, Xiwen, et al.
Pubblicazione: (2023)
Self-supervised vision-langage alignment of deep learning representations for bone X-rays analysis
di: Englebert, Alexandre, et al.
Pubblicazione: (2024)
di: Englebert, Alexandre, et al.
Pubblicazione: (2024)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
di: Wang, Zihang, et al.
Pubblicazione: (2026)
di: Wang, Zihang, et al.
Pubblicazione: (2026)
World-to-Words: Grounded Open Vocabulary Acquisition through Fast Mapping in Vision-Language Models
di: Ma, Ziqiao, et al.
Pubblicazione: (2023)
di: Ma, Ziqiao, et al.
Pubblicazione: (2023)
Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach
di: Sakajo, Haruki, et al.
Pubblicazione: (2025)
di: Sakajo, Haruki, et al.
Pubblicazione: (2025)
EvolveNav: Empowering LLM-Based Vision-Language Navigation via Self-Improving Embodied Reasoning
di: Lin, Bingqian, et al.
Pubblicazione: (2025)
di: Lin, Bingqian, et al.
Pubblicazione: (2025)
Vision Token Reduction via Attention-Driven Self-Compression for Efficient Multimodal Large Language Models
di: Deniz, Omer Faruk, et al.
Pubblicazione: (2026)
di: Deniz, Omer Faruk, et al.
Pubblicazione: (2026)
Multiple Random Masking Autoencoder Ensembles for Robust Multimodal Semi-supervised Learning
di: Todoran, Alexandru-Raul, et al.
Pubblicazione: (2024)
di: Todoran, Alexandru-Raul, et al.
Pubblicazione: (2024)
Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding
di: Wang, Ye, et al.
Pubblicazione: (2025)
di: Wang, Ye, et al.
Pubblicazione: (2025)
PEEB: Part-based Image Classifiers with an Explainable and Editable Language Bottleneck
di: Pham, Thang M., et al.
Pubblicazione: (2024)
di: Pham, Thang M., et al.
Pubblicazione: (2024)
Weaving Context Across Images: Improving Vision-Language Models through Focus-Centric Visual Chains
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
di: Zhang, Juntian, et al.
Pubblicazione: (2025)
TimeViper: A Hybrid Mamba-Transformer Vision-Language Model for Efficient Long Video Understanding
di: Xu, Boshen, et al.
Pubblicazione: (2025)
di: Xu, Boshen, et al.
Pubblicazione: (2025)
Reasoning in the Dark: Interleaved Vision-Text Reasoning in Latent Space
di: Chen, Chao, et al.
Pubblicazione: (2025)
di: Chen, Chao, et al.
Pubblicazione: (2025)
Flat-Pack Bench: Evaluating Spatio-Temporal Understanding in Large Vision-Language Models through Furniture Assembly
di: Chetan, Aditya, et al.
Pubblicazione: (2026)
di: Chetan, Aditya, et al.
Pubblicazione: (2026)
VisionGraph: Leveraging Large Multimodal Models for Graph Theory Problems in Visual Context
di: Li, Yunxin, et al.
Pubblicazione: (2024)
di: Li, Yunxin, et al.
Pubblicazione: (2024)
Revisiting the Role of Language Priors in Vision-Language Models
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
WildVision: Evaluating Vision-Language Models in the Wild with Human Preferences
di: Lu, Yujie, et al.
Pubblicazione: (2024)
di: Lu, Yujie, et al.
Pubblicazione: (2024)
Survey on Vision-Language-Action Models
di: Adilkhanov, Adilzhan, et al.
Pubblicazione: (2025)
di: Adilkhanov, Adilzhan, et al.
Pubblicazione: (2025)
Panoptic Vision-Language Feature Fields
di: Chen, Haoran, et al.
Pubblicazione: (2023)
di: Chen, Haoran, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Towards Zero-Shot & Explainable Video Description by Reasoning over Graphs of Events in Space and Time
di: Masala, Mihai, et al.
Pubblicazione: (2025) -
Agentic Video Generation: From Text to Executable Event Graphs via Tool-Constrained LLM Planning
di: Cudlenco, Nicolae, et al.
Pubblicazione: (2026) -
GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models
di: Cudlenco, Nicolae, et al.
Pubblicazione: (2026) -
Inside Knowledge: Graph-based Path Generation with Explainable Data Augmentation and Curriculum Learning for Visual Indoor Navigation
di: Airinei, Daniel, et al.
Pubblicazione: (2025) -
Probabilistic Hyper-Graphs using Multiple Randomly Masked Autoencoders for Semi-supervised Multi-modal Multi-task Learning
di: Mihai-Cristian, Pîrvu, et al.
Pubblicazione: (2025)