Enregistré dans:
| Auteurs principaux: | Flores, Erick Andrew Bustamante, Olivera, Harley Vera, Valencia, Ivan Cesar Medrano, Cubas, Carlos Fernando Montoya |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2502.00939 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Banana Ripeness Level Classification using a Simple CNN Model Trained with Real and Synthetic Datasets
par: Chuquimarca, Luis, et autres
Publié: (2025)
par: Chuquimarca, Luis, et autres
Publié: (2025)
Sequence Matters: Harnessing Video Models in 3D Super-Resolution
par: Ko, Hyun-kyu, et autres
Publié: (2024)
par: Ko, Hyun-kyu, et autres
Publié: (2024)
Learning Association via Track-Detection Matching for Multi-Object Tracking
par: Adžemović, Momir
Publié: (2025)
par: Adžemović, Momir
Publié: (2025)
MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation
par: Guo, Zhenglong, et autres
Publié: (2025)
par: Guo, Zhenglong, et autres
Publié: (2025)
Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language Models
par: Li, Jinhao, et autres
Publié: (2024)
par: Li, Jinhao, et autres
Publié: (2024)
When Less is Enough: Adaptive Token Reduction for Efficient Image Representation
par: Allakhverdov, Eduard, et autres
Publié: (2025)
par: Allakhverdov, Eduard, et autres
Publié: (2025)
Image Reconstruction as a Tool for Feature Analysis
par: Allakhverdov, Eduard, et autres
Publié: (2025)
par: Allakhverdov, Eduard, et autres
Publié: (2025)
Predicting Pedestrian Crossing Behavior in Germany and Japan: Insights into Model Transferability
par: Zhang, Chi, et autres
Publié: (2024)
par: Zhang, Chi, et autres
Publié: (2024)
Tricks and Plug-ins for Gradient Boosting in Image Classification
par: Fang, Biyi, et autres
Publié: (2025)
par: Fang, Biyi, et autres
Publié: (2025)
Learning Discriminative Spatio-temporal Representations for Semi-supervised Action Recognition
par: Wang, Yu, et autres
Publié: (2024)
par: Wang, Yu, et autres
Publié: (2024)
Meaning over Motion: A Semantic-First Approach to 360° Viewport Prediction
par: Khah, Arman Nik, et autres
Publié: (2026)
par: Khah, Arman Nik, et autres
Publié: (2026)
DSER: Spectral Epipolar Representation for Efficient Light Field Depth Estimation
par: Mohammad, Noor Islam S., et autres
Publié: (2025)
par: Mohammad, Noor Islam S., et autres
Publié: (2025)
Hierarchical Spatial Algorithms for High-Resolution Image Quantization and Feature Extraction
par: Mohammad, Noor Islam S.
Publié: (2025)
par: Mohammad, Noor Islam S.
Publié: (2025)
Combined Hyperbolic and Euclidean Soft Triple Loss Beyond the Single Space Deep Metric Learning
par: Saeki, Shozo, et autres
Publié: (2025)
par: Saeki, Shozo, et autres
Publié: (2025)
Learning Sign Language Representation using CNN LSTM, 3DCNN, CNN RNN LSTM and CCN TD
par: Louison, Nikita, et autres
Publié: (2024)
par: Louison, Nikita, et autres
Publié: (2024)
Video-STR: Reinforcing MLLMs in Video Spatio-Temporal Reasoning with Relation Graph
par: Wang, Wentao, et autres
Publié: (2025)
par: Wang, Wentao, et autres
Publié: (2025)
Surg$Σ$: A Spectrum of Large-Scale Multimodal Data and Foundation Models for Surgical Intelligence
par: Zeng, Zhitao, et autres
Publié: (2026)
par: Zeng, Zhitao, et autres
Publié: (2026)
DOD-SA: Infrared-Visible Decoupled Object Detection with Single-Modality Annotations
par: Jin, Hang, et autres
Publié: (2025)
par: Jin, Hang, et autres
Publié: (2025)
Non-Robust Features are Not Always Useful in One-Class Classification
par: Lau, Matthew, et autres
Publié: (2024)
par: Lau, Matthew, et autres
Publié: (2024)
SynthRender and IRIS: Open-Source Framework and Dataset for Bidirectional Sim-Real Transfer in Industrial Object Perception
par: Araya-Martinez, Jose Moises, et autres
Publié: (2026)
par: Araya-Martinez, Jose Moises, et autres
Publié: (2026)
CLIP-Joint-Detect: End-to-End Joint Training of Object Detectors with Contrastive Vision-Language Supervision
par: Raoufi, Behnam, et autres
Publié: (2025)
par: Raoufi, Behnam, et autres
Publié: (2025)
Edged USLAM: Edge-Aware Event-Based SLAM with Learning-Based Depth Priors
par: Sarıözkan, Şebnem, et autres
Publié: (2026)
par: Sarıözkan, Şebnem, et autres
Publié: (2026)
Fast 3D point clouds retrieval for Large-scale 3D Place Recognition
par: Zede, Chahine-Nicolas, et autres
Publié: (2025)
par: Zede, Chahine-Nicolas, et autres
Publié: (2025)
An M-Health Algorithmic Approach to Identify and Assess Physiotherapy Exercises in Real Time
par: Kandylakis, Stylianos, et autres
Publié: (2025)
par: Kandylakis, Stylianos, et autres
Publié: (2025)
DeepFusionNet: Autoencoder-Based Low-Light Image Enhancement and Super-Resolution
par: Çalışkan, Halil Hüseyin, et autres
Publié: (2025)
par: Çalışkan, Halil Hüseyin, et autres
Publié: (2025)
EventFlow: Real-Time Neuromorphic Event-Driven Classification of Two-Phase Boiling Flow Regimes
par: Chang, Sanghyeon, et autres
Publié: (2025)
par: Chang, Sanghyeon, et autres
Publié: (2025)
Evaluating Visual Mathematics in Multimodal LLMs: A Multilingual Benchmark Based on the Kangaroo Tests
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
par: Sáez, Arnau Igualde, et autres
Publié: (2025)
CADE 2.5 - ZeResFDG: Frequency-Decoupled, Rescaled and Zero-Projected Guidance for SD/SDXL Latent Diffusion Models
par: Rychkovskiy, Denis
Publié: (2025)
par: Rychkovskiy, Denis
Publié: (2025)
Sat-JEPA-Diff: Bridging Self-Supervised Learning and Generative Diffusion for Remote Sensing
par: Komurcu, Kursat, et autres
Publié: (2026)
par: Komurcu, Kursat, et autres
Publié: (2026)
A Labeled Array Distance Metric for Measuring Image Segmentation Quality
par: Berijanian, Maryam, et autres
Publié: (2024)
par: Berijanian, Maryam, et autres
Publié: (2024)
MeshPose: Unifying DensePose and 3D Body Mesh reconstruction
par: Lê, Eric-Tuan, et autres
Publié: (2024)
par: Lê, Eric-Tuan, et autres
Publié: (2024)
A large-scale, physically-based synthetic dataset for satellite pose estimation
par: Velkei, Szabolcs, et autres
Publié: (2025)
par: Velkei, Szabolcs, et autres
Publié: (2025)
PathFormer: A Transformer with 3D Grid Constraints for Digital Twin Robot-Arm Trajectory Generation
par: Alanazi, Ahmed, et autres
Publié: (2025)
par: Alanazi, Ahmed, et autres
Publié: (2025)
Beyond RGB: Leveraging Vision Transformers for Thermal Weapon Segmentation
par: Kambhatla, Akhila, et autres
Publié: (2025)
par: Kambhatla, Akhila, et autres
Publié: (2025)
ShapBPT: Image Feature Attributions Using Data-Aware Binary Partition Trees
par: Rashid, Muhammad, et autres
Publié: (2026)
par: Rashid, Muhammad, et autres
Publié: (2026)
TerraSeg: Self-Supervised Ground Segmentation for Any LiDAR
par: Lentsch, Ted, et autres
Publié: (2026)
par: Lentsch, Ted, et autres
Publié: (2026)
UNION: Unsupervised 3D Object Detection using Object Appearance-based Pseudo-Classes
par: Lentsch, Ted, et autres
Publié: (2024)
par: Lentsch, Ted, et autres
Publié: (2024)
Do Generative Metrics Predict YOLO Performance? An Evaluation Across Models, Augmentation Ratios, and Dataset Complexity
par: Marian, Vasile, et autres
Publié: (2026)
par: Marian, Vasile, et autres
Publié: (2026)
MB-DSMIL-CL-PL: Scalable Weakly Supervised Ovarian Cancer Subtype Classification and Localisation Using Contrastive and Prototype Learning with Frozen Patch Features
par: Jenkins, Marcus, et autres
Publié: (2026)
par: Jenkins, Marcus, et autres
Publié: (2026)
Explainable AI for Analyzing Person-Specific Patterns in Facial Recognition Tasks
par: Borsukiewicz, Paweł Jakub, et autres
Publié: (2025)
par: Borsukiewicz, Paweł Jakub, et autres
Publié: (2025)
Documents similaires
-
Banana Ripeness Level Classification using a Simple CNN Model Trained with Real and Synthetic Datasets
par: Chuquimarca, Luis, et autres
Publié: (2025) -
Sequence Matters: Harnessing Video Models in 3D Super-Resolution
par: Ko, Hyun-kyu, et autres
Publié: (2024) -
Learning Association via Track-Detection Matching for Multi-Object Tracking
par: Adžemović, Momir
Publié: (2025) -
MaP-AVR: A Meta-Action Planner for Agents Leveraging Vision Language Models and Retrieval-Augmented Generation
par: Guo, Zhenglong, et autres
Publié: (2025) -
Visual-Text Cross Alignment: Refining the Similarity Score in Vision-Language Models
par: Li, Jinhao, et autres
Publié: (2024)