You Actually Look Twice At it (YALTAi): using an object detection approach instead of region segmentation within the Kraken engine
Fuente:
arXiv
Enregistré dans:
| Auteur principal: | Clérice, Thibault |
|---|---|
| Format: | Preprint |
| Publié: |
2022
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
par: Karamolegkou, Antonia, et autres
Publié: (2026)
par: Karamolegkou, Antonia, et autres
Publié: (2026)
Look Twice: Training-Free Evidence Highlighting in Multimodal Large Language Models
par: Morini, Marco, et autres
Publié: (2026)
par: Morini, Marco, et autres
Publié: (2026)
FusionVision: A comprehensive approach of 3D object reconstruction and segmentation from RGB-D cameras using YOLO and fast segment anything
par: Ghazouali, Safouane El, et autres
Publié: (2024)
par: Ghazouali, Safouane El, et autres
Publié: (2024)
Deep learning approaches to surgical video segmentation and object detection: A Scoping Review
par: Kamtam, Devanish N., et autres
Publié: (2025)
par: Kamtam, Devanish N., et autres
Publié: (2025)
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
par: Chen, Kaitao, et autres
Publié: (2025)
par: Chen, Kaitao, et autres
Publié: (2025)
Look Before You Decide: Prompting Active Deduction of MLLMs for Assumptive Reasoning
par: Li, Yian, et autres
Publié: (2024)
par: Li, Yian, et autres
Publié: (2024)
An efficient plant disease detection using transfer learning approach
par: Sambana, Bosubabu, et autres
Publié: (2025)
par: Sambana, Bosubabu, et autres
Publié: (2025)
Discovering and using Spelke segments
par: Venkatesh, Rahul, et autres
Publié: (2025)
par: Venkatesh, Rahul, et autres
Publié: (2025)
Technical note: ShinyAnimalCV: open-source cloud-based web application for object detection, segmentation, and three-dimensional visualization of animals using computer vision
par: Wang, Jin, et autres
Publié: (2023)
par: Wang, Jin, et autres
Publié: (2023)
Scene-aware SAR ship detection guided by unsupervised sea-land segmentation
par: Ke, Han, et autres
Publié: (2025)
par: Ke, Han, et autres
Publié: (2025)
Study of detecting behavioral signatures within DeepFake videos
par: Miao, Qiaomu, et autres
Publié: (2022)
par: Miao, Qiaomu, et autres
Publié: (2022)
Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection
par: Li, Xiang, et autres
Publié: (2025)
par: Li, Xiang, et autres
Publié: (2025)
Think Twice, Click Once: Enhancing GUI Grounding via Fast and Slow Systems
par: Tang, Fei, et autres
Publié: (2025)
par: Tang, Fei, et autres
Publié: (2025)
Detecting Sexual Content at the Sentence Level in First Millennium Latin Texts
par: Clérice, Thibault
Publié: (2023)
par: Clérice, Thibault
Publié: (2023)
Agricultural Object Detection with You Look Only Once (YOLO) Algorithm: A Bibliometric and Systematic Literature Review
par: Badgujar, Chetan M, et autres
Publié: (2024)
par: Badgujar, Chetan M, et autres
Publié: (2024)
You Only Look Twice! for Failure Causes Identification of Drill Bits
par: Yamani, Asma, et autres
Publié: (2024)
par: Yamani, Asma, et autres
Publié: (2024)
Improving segmentation of retinal arteries and veins using cardiac signal in doppler holograms
par: Dubosc, Marius, et autres
Publié: (2025)
par: Dubosc, Marius, et autres
Publié: (2025)
Region of interest detection for efficient aortic segmentation
par: Giordano, Loris, et autres
Publié: (2026)
par: Giordano, Loris, et autres
Publié: (2026)
GCA-ResUNet:Image segmentation in medical images using grouped coordinate attention
par: Ding, Jun, et autres
Publié: (2025)
par: Ding, Jun, et autres
Publié: (2025)
What are You Looking at? Modality Contribution in Multimodal Medical Deep Learning
par: Gapp, Christian, et autres
Publié: (2025)
par: Gapp, Christian, et autres
Publié: (2025)
Mamba meets crack segmentation
par: He, Zhili, et autres
Publié: (2024)
par: He, Zhili, et autres
Publié: (2024)
Barlow-Swin: Toward a novel siamese-based segmentation architecture using Swin-Transformers
par: Haftlang, Morteza Kiani, et autres
Publié: (2025)
par: Haftlang, Morteza Kiani, et autres
Publié: (2025)
BFA-YOLO: A balanced multiscale object detection network for building façade attachments detection
par: Chen, Yangguang, et autres
Publié: (2024)
par: Chen, Yangguang, et autres
Publié: (2024)
Underwater object detection in sonar imagery with detection transformer and Zero-shot neural architecture search
par: Gu, XiaoTong, et autres
Publié: (2025)
par: Gu, XiaoTong, et autres
Publié: (2025)
Batch Transformer: Look for Attention in Batch
par: Her, Myung Beom, et autres
Publié: (2024)
par: Her, Myung Beom, et autres
Publié: (2024)
LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models
par: Shen, Yuxiang, et autres
Publié: (2026)
par: Shen, Yuxiang, et autres
Publié: (2026)
A multimodal deep learning architecture for smoking detection with a small data approach
par: Lakatos, Robert, et autres
Publié: (2023)
par: Lakatos, Robert, et autres
Publié: (2023)
Is SAM3 ready for pathology segmentation?
par: Kong, Qiuyu, et autres
Publié: (2026)
par: Kong, Qiuyu, et autres
Publié: (2026)
Eye image segmentation using visual and concept prompts with Segment Anything Model 3 (SAM3)
par: Niehorster, Diederick C., et autres
Publié: (2026)
par: Niehorster, Diederick C., et autres
Publié: (2026)
Active learning for efficient annotation in precision agriculture: a use-case on crop-weed semantic segmentation
par: van Marrewijk, Bart M., et autres
Publié: (2024)
par: van Marrewijk, Bart M., et autres
Publié: (2024)
Polyp detection in colonoscopy images using YOLOv11
par: Sahoo, Alok Ranjan, et autres
Publié: (2025)
par: Sahoo, Alok Ranjan, et autres
Publié: (2025)
Multi-head automated segmentation by incorporating detection head into the contextual layer neural network
par: Kys, Edwin, et autres
Publié: (2026)
par: Kys, Edwin, et autres
Publié: (2026)
Semi-supervised segmentation of land cover images using nonlinear canonical correlation analysis with multiple features and t-SNE
par: Wei, Hong, et autres
Publié: (2024)
par: Wei, Hong, et autres
Publié: (2024)
I Am Big, You Are Little; I Am Right, You Are Wrong
par: Kelly, David A., et autres
Publié: (2025)
par: Kelly, David A., et autres
Publié: (2025)
Looking into Concept Explanation Methods for Diabetic Retinopathy Classification
par: Storås, Andrea M., et autres
Publié: (2024)
par: Storås, Andrea M., et autres
Publié: (2024)
MLN-net: A multi-source medical image segmentation method for clustered microcalcifications using multiple layer normalization
par: Wang, Ke, et autres
Publié: (2023)
par: Wang, Ke, et autres
Publié: (2023)
Why We Look Where We Look: Emergent Human-like Fixations of a Foveated Visual Language Model Maximizing Scene Understanding
par: Murlidaran, Shravan, et autres
Publié: (2026)
par: Murlidaran, Shravan, et autres
Publié: (2026)
Enhancing kelp forest detection in remote sensing images using crowdsourced labels with Mixed Vision Transformers and ConvNeXt segmentation models
par: Nasios, Ioannis
Publié: (2025)
par: Nasios, Ioannis
Publié: (2025)
Think Twice before Adaptation: Improving Adaptability of DeepFake Detection via Online Test-Time Adaptation
par: Nguyen-Le, Hong-Hanh, et autres
Publié: (2025)
par: Nguyen-Le, Hong-Hanh, et autres
Publié: (2025)
Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding
par: Wang, Wenkai, et autres
Publié: (2026)
par: Wang, Wenkai, et autres
Publié: (2026)
Documents similaires
-
Reading or Guessing? Visual Grounding Failures of Vision-Language Models for OCR in Ancient Greek Editions
par: Karamolegkou, Antonia, et autres
Publié: (2026) -
Look Twice: Training-Free Evidence Highlighting in Multimodal Large Language Models
par: Morini, Marco, et autres
Publié: (2026) -
FusionVision: A comprehensive approach of 3D object reconstruction and segmentation from RGB-D cameras using YOLO and fast segment anything
par: Ghazouali, Safouane El, et autres
Publié: (2024) -
Deep learning approaches to surgical video segmentation and object detection: A Scoping Review
par: Kamtam, Devanish N., et autres
Publié: (2025) -
Think Twice to See More: Iterative Visual Reasoning in Medical VLMs
par: Chen, Kaitao, et autres
Publié: (2025)