Enregistré dans:
| Auteurs principaux: | Oliveira, Daniel A. P., de Matos, David Martins |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2507.07340 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Transfer-learning for video classification: Video Swin Transformer on multiple domains
par: Oliveira, Daniel A. P., et autres
Publié: (2022)
par: Oliveira, Daniel A. P., et autres
Publié: (2022)
StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles
par: Oliveira, Daniel, et autres
Publié: (2026)
par: Oliveira, Daniel, et autres
Publié: (2026)
Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning
par: Ji, Binbin, et autres
Publié: (2025)
par: Ji, Binbin, et autres
Publié: (2025)
Trapped in texture bias? A large scale comparison of deep instance segmentation
par: Theodoridis, Johannes, et autres
Publié: (2024)
par: Theodoridis, Johannes, et autres
Publié: (2024)
Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy
par: Sutton, Matthew, et autres
Publié: (2026)
par: Sutton, Matthew, et autres
Publié: (2026)
Multimodal Approaches for Visually-Rich Document Type Classification: A Comparative Analysis
par: Heyne, Catyana, et autres
Publié: (2026)
par: Heyne, Catyana, et autres
Publié: (2026)
Sign language recognition based on deep learning and low-cost handcrafted descriptors
par: Carneiro, Alvaro Leandro Cavalcante, et autres
Publié: (2024)
par: Carneiro, Alvaro Leandro Cavalcante, et autres
Publié: (2024)
Learning from Semantic Dictionaries: Discriminative Codebook Contrastive Learning for Unified Visual Representation and Generation
par: Estepa, Imanol G., et autres
Publié: (2026)
par: Estepa, Imanol G., et autres
Publié: (2026)
GroundCap: A Visually Grounded Image Captioning Dataset
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
Story Generation from Visual Inputs: Techniques, Related Tasks, and Challenges
par: Oliveira, Daniel A. P., et autres
Publié: (2024)
par: Oliveira, Daniel A. P., et autres
Publié: (2024)
Sparse Concept Bottleneck Models: Gumbel Tricks in Contrastive Learning
par: Semenov, Andrei, et autres
Publié: (2024)
par: Semenov, Andrei, et autres
Publié: (2024)
InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information
par: Iyengar, Anirudh Iyengar Kaniyar Narayana, et autres
Publié: (2025)
par: Iyengar, Anirudh Iyengar Kaniyar Narayana, et autres
Publié: (2025)
StoryReasoning Dataset: Using Chain-of-Thought for Scene Understanding and Grounded Story Generation
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
par: Oliveira, Daniel A. P., et autres
Publié: (2025)
GAEA: A Geolocation Aware Conversational Assistant
par: Campos, Ron, et autres
Publié: (2025)
par: Campos, Ron, et autres
Publié: (2025)
Proximity QA: Unleashing the Power of Multi-Modal Large Language Models for Spatial Proximity Analysis
par: Li, Jianing, et autres
Publié: (2024)
par: Li, Jianing, et autres
Publié: (2024)
Prompt-Driven Building Footprint Extraction in Aerial Images with Offset-Building Model
par: Li, Kai, et autres
Publié: (2023)
par: Li, Kai, et autres
Publié: (2023)
All4One: Symbiotic Neighbour Contrastive Learning via Self-Attention and Redundancy Reduction
par: Estepa, Imanol G., et autres
Publié: (2023)
par: Estepa, Imanol G., et autres
Publié: (2023)
MRD: Using Physically Based Differentiable Rendering to Probe Vision Models for 3D Scene Understanding
par: Beilharz, Benjamin, et autres
Publié: (2025)
par: Beilharz, Benjamin, et autres
Publié: (2025)
WaveMix: A Resource-efficient Neural Network for Image Analysis
par: Jeevan, Pranav, et autres
Publié: (2022)
par: Jeevan, Pranav, et autres
Publié: (2022)
Gaussian Splatting: 3D Reconstruction and Novel View Synthesis, a Review
par: Dalal, Anurag, et autres
Publié: (2024)
par: Dalal, Anurag, et autres
Publié: (2024)
CCVA-FL: Cross-Client Variations Adaptive Federated Learning for Medical Imaging
par: Gupta, Sunny, et autres
Publié: (2024)
par: Gupta, Sunny, et autres
Publié: (2024)
Large Language Models for Simultaneous Named Entity Extraction and Spelling Correction
par: Whittaker, Edward, et autres
Publié: (2024)
par: Whittaker, Edward, et autres
Publié: (2024)
Vision transformers in domain adaptation and domain generalization: a study of robustness
par: Alijani, Shadi, et autres
Publié: (2024)
par: Alijani, Shadi, et autres
Publié: (2024)
SYNOSIS: Image synthesis pipeline for machine vision in metal surface inspection
par: Fulir, Juraj, et autres
Publié: (2024)
par: Fulir, Juraj, et autres
Publié: (2024)
Which Backbone to Use: A Resource-efficient Domain Specific Comparison for Computer Vision
par: Jeevan, Pranav, et autres
Publié: (2024)
par: Jeevan, Pranav, et autres
Publié: (2024)
MANGO: Learning Disentangled Image Transformation Manifolds with Grouped Operators
par: Ancelin, Brighton, et autres
Publié: (2024)
par: Ancelin, Brighton, et autres
Publié: (2024)
FLD+: Data-efficient Evaluation Metric for Generative Models
par: Jeevan, Pranav, et autres
Publié: (2024)
par: Jeevan, Pranav, et autres
Publié: (2024)
WaveMixSR-V2: Enhancing Super-resolution with Higher Efficiency
par: Jeevan, Pranav, et autres
Publié: (2024)
par: Jeevan, Pranav, et autres
Publié: (2024)
Normalizing Flow-Based Metric for Image Generation
par: Jeevan, Pranav, et autres
Publié: (2024)
par: Jeevan, Pranav, et autres
Publié: (2024)
Devanagari Handwritten Character Recognition using Convolutional Neural Network
par: Mehta, Diksha, et autres
Publié: (2025)
par: Mehta, Diksha, et autres
Publié: (2025)
Canonical Space Representation for 4D Panoptic Segmentation of Articulated Objects
par: Gomes, Manuel, et autres
Publié: (2025)
par: Gomes, Manuel, et autres
Publié: (2025)
Eye-gaze Guided Multi-modal Alignment for Medical Representation Learning
par: Ma, Chong, et autres
Publié: (2024)
par: Ma, Chong, et autres
Publié: (2024)
The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering
par: Pandey, Anupam, et autres
Publié: (2025)
par: Pandey, Anupam, et autres
Publié: (2025)
Taming the Tail: Leveraging Asymmetric Loss and Pade Approximation to Overcome Medical Image Long-Tailed Class Imbalance
par: Kashyap, Pankhi, et autres
Publié: (2024)
par: Kashyap, Pankhi, et autres
Publié: (2024)
Fine-Tuning Vision-Language Models for Understanding Current Damage and Scoring Priority with Quality Guard Agent
par: Yasuno, Takato
Publié: (2026)
par: Yasuno, Takato
Publié: (2026)
Exploiting Causality Signals in Medical Images: A Pilot Study with Empirical Results
par: Carloni, Gianluca, et autres
Publié: (2023)
par: Carloni, Gianluca, et autres
Publié: (2023)
LiftAvatar: Kinematic-Space Completion for Expression-Controlled 3D Gaussian Avatar Animation
par: Wei, Hualiang, et autres
Publié: (2026)
par: Wei, Hualiang, et autres
Publié: (2026)
Tversky Neural Networks: Psychologically Plausible Deep Learning with Differentiable Tversky Similarity
par: Doumbouya, Moussa Koulako Bala, et autres
Publié: (2025)
par: Doumbouya, Moussa Koulako Bala, et autres
Publié: (2025)
Evaluation Metric for Quality Control and Generative Models in Histopathology Images
par: Jeevan, Pranav, et autres
Publié: (2024)
par: Jeevan, Pranav, et autres
Publié: (2024)
Learnings from Scaling Visual Tokenizers for Reconstruction and Generation
par: Hansen-Estruch, Philippe, et autres
Publié: (2025)
par: Hansen-Estruch, Philippe, et autres
Publié: (2025)
Documents similaires
-
Transfer-learning for video classification: Video Swin Transformer on multiple domains
par: Oliveira, Daniel A. P., et autres
Publié: (2022) -
StoryMovie: A Dataset for Semantic Alignment of Visual Stories with Movie Scripts and Subtitles
par: Oliveira, Daniel, et autres
Publié: (2026) -
Enhancing Spatial Reasoning in Vision-Language Models via Chain-of-Thought Prompting and Reinforcement Learning
par: Ji, Binbin, et autres
Publié: (2025) -
Trapped in texture bias? A large scale comparison of deep instance segmentation
par: Theodoridis, Johannes, et autres
Publié: (2024) -
Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy
par: Sutton, Matthew, et autres
Publié: (2026)