A Hybrid Vision Transformer Approach for Mathematical Expression Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Le, Anh Duy, Pham, Van Linh, Ly, Vinh Loi, Nguyen, Nam Quan, Nguyen, Huu Thang, Tran, Tuan Anh |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SepFormer: Coarse-to-fine Separator Regression Network for Table Structure Recognition
par: Nguyen, Nam Quan, et autres
Publié: (2025)
par: Nguyen, Nam Quan, et autres
Publié: (2025)
CONSTANT: Towards High-Quality One-Shot Handwriting Generation with Patch Contrastive Enhancement and Style-Aware Quantization
par: Le, Anh-Duy, et autres
Publié: (2026)
par: Le, Anh-Duy, et autres
Publié: (2026)
Facial Expression Recognition Using Residual Masking Network
par: Pham, Luan, et autres
Publié: (2026)
par: Pham, Luan, et autres
Publié: (2026)
Cycle Training with Semi-Supervised Domain Adaptation: Bridging Accuracy and Efficiency for Real-Time Mobile Scene Detection
par: Phan-Nguyen, Huu-Phong, et autres
Publié: (2025)
par: Phan-Nguyen, Huu-Phong, et autres
Publié: (2025)
SuMa: A Subspace Mapping Approach for Robust and Effective Concept Erasure in Text-to-Image Diffusion Models
par: Nguyen, Kien, et autres
Publié: (2025)
par: Nguyen, Kien, et autres
Publié: (2025)
A Lightweight Moment Retrieval System with Global Re-Ranking and Robust Adaptive Bidirectional Temporal Search
par: Nguyen-Nhu, Tinh-Anh, et autres
Publié: (2025)
par: Nguyen-Nhu, Tinh-Anh, et autres
Publié: (2025)
MedSteer: Counterfactual Endoscopic Synthesis via Training-Free Activation Steering
par: Pham, Trong-Thang, et autres
Publié: (2026)
par: Pham, Trong-Thang, et autres
Publié: (2026)
Towards Efficient and Robust Moment Retrieval System: A Unified Framework for Multi-Granularity Models and Temporal Reranking
par: Tran, Huu-Loc, et autres
Publié: (2025)
par: Tran, Huu-Loc, et autres
Publié: (2025)
FlexEdit: Flexible and Controllable Diffusion-based Object-centric Image Editing
par: Nguyen, Trong-Tung, et autres
Publié: (2024)
par: Nguyen, Trong-Tung, et autres
Publié: (2024)
Hybrid, Unified and Iterative: A Novel Framework for Text-based Person Anomaly Retrieval
par: Nguyen, Tien-Huy, et autres
Publié: (2025)
par: Nguyen, Tien-Huy, et autres
Publié: (2025)
RT-VLM: Re-Thinking Vision Language Model with 4-Clues for Real-World Object Recognition Robustness
par: Park, Junghyun, et autres
Publié: (2025)
par: Park, Junghyun, et autres
Publié: (2025)
Supercharged One-step Text-to-Image Diffusion Models with Negative Prompts
par: Nguyen, Viet, et autres
Publié: (2024)
par: Nguyen, Viet, et autres
Publié: (2024)
Semi-supervised 3D Semantic Scene Completion with 2D Vision Foundation Model Guidance
par: Pham, Duc-Hai, et autres
Publié: (2024)
par: Pham, Duc-Hai, et autres
Publié: (2024)
BALM: A Model-Agnostic Framework for Balanced Multimodal Learning under Imbalanced Missing Rates
par: Nguyen, Phuong-Anh, et autres
Publié: (2026)
par: Nguyen, Phuong-Anh, et autres
Publié: (2026)
MissBench: Benchmarking Multimodal Affective Analysis under Imbalanced Missing Modalities
par: Pham, Tien Anh, et autres
Publié: (2026)
par: Pham, Tien Anh, et autres
Publié: (2026)
Enhancing Vietnamese VQA through Curriculum Learning on Raw and Augmented Text Representations
par: Nguyen, Khoi Anh, et autres
Publié: (2025)
par: Nguyen, Khoi Anh, et autres
Publié: (2025)
DuFal: Dual-Frequency-Aware Learning for High-Fidelity Extremely Sparse-view CBCT Reconstruction
par: Van, Cuong Tran, et autres
Publié: (2026)
par: Van, Cuong Tran, et autres
Publié: (2026)
Unpaired Image Dehazing via Kolmogorov-Arnold Transformation of Latent Features
par: Tran, Le-Anh
Publié: (2025)
par: Tran, Le-Anh
Publié: (2025)
Hierarchical Neural Collapse Detection Transformer for Class Incremental Object Detection
par: Pham, Duc Thanh, et autres
Publié: (2025)
par: Pham, Duc Thanh, et autres
Publié: (2025)
ScriptHOI: Learning Scripted State Transitions for Open-Vocabulary Human-Object Interaction Detection
par: Nguyen, Minh Anh, et autres
Publié: (2026)
par: Nguyen, Minh Anh, et autres
Publié: (2026)
More Reliable Pseudo-labels, Better Performance: A Generalized Approach to Single Positive Multi-label Learning
par: Tran, Luong, et autres
Publié: (2025)
par: Tran, Luong, et autres
Publié: (2025)
Interpreting Radiologist's Intention from Eye Movements in Chest X-ray Diagnosis
par: Pham, Trong-Thang, et autres
Publié: (2025)
par: Pham, Trong-Thang, et autres
Publié: (2025)
A4O: All Trigger for One sample
par: Vu, Duc Anh, et autres
Publié: (2025)
par: Vu, Duc Anh, et autres
Publié: (2025)
ViOCRVQA: Novel Benchmark Dataset and Vision Reader for Visual Question Answering by Understanding Vietnamese Text in Images
par: Pham, Huy Quang, et autres
Publié: (2024)
par: Pham, Huy Quang, et autres
Publié: (2024)
Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding
par: Nguyen, Thong, et autres
Publié: (2025)
par: Nguyen, Thong, et autres
Publié: (2025)
Virtual Fusion with Contrastive Learning for Single Sensor-based Activity Recognition
par: Nguyen, Duc-Anh, et autres
Publié: (2023)
par: Nguyen, Duc-Anh, et autres
Publié: (2023)
A2VIS: Amodal-Aware Approach to Video Instance Segmentation
par: Tran, Minh, et autres
Publié: (2024)
par: Tran, Minh, et autres
Publié: (2024)
Revisit Visual Prompt Tuning: The Expressiveness of Prompt Experts
par: Le, Minh, et autres
Publié: (2025)
par: Le, Minh, et autres
Publié: (2025)
A Survey on Vietnamese Document Analysis and Recognition: Challenges and Future Directions
par: Le, Anh, et autres
Publié: (2025)
par: Le, Anh, et autres
Publié: (2025)
Enhancing Multimodal Entity Linking with Jaccard Distance-based Conditional Contrastive Learning and Contextual Visual Augmentation
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
SwiftEdit: Lightning Fast Text-Guided Image Editing via One-Step Diffusion
par: Nguyen, Trong-Tung, et autres
Publié: (2024)
par: Nguyen, Trong-Tung, et autres
Publié: (2024)
CutPaste&Find: Efficient Multimodal Hallucination Detector with Visual-aid Knowledge Base
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
par: Nguyen, Cong-Duy, et autres
Publié: (2025)
Any3DIS: Class-Agnostic 3D Instance Segmentation by 2D Mask Tracking
par: Nguyen, Phuc, et autres
Publié: (2024)
par: Nguyen, Phuc, et autres
Publié: (2024)
Stable Messenger: Steganography for Message-Concealed Image Generation
par: Nguyen, Quang, et autres
Publié: (2023)
par: Nguyen, Quang, et autres
Publié: (2023)
Counting to Four is still a Chore for VLMs
par: Anh, Duy Le Dinh, et autres
Publié: (2026)
par: Anh, Duy Le Dinh, et autres
Publié: (2026)
UIT-DarkCow team at ImageCLEFmedical Caption 2024: Diagnostic Captioning for Radiology Images Efficiency with Transformer Models
par: Van Nguyen, Quan, et autres
Publié: (2024)
par: Van Nguyen, Quan, et autres
Publié: (2024)
Efficient INT8 Single-Image Super-Resolution via Deployment-Aware Quantization and Teacher-Guided Training
par: Nguyen, Pham Phuong Nam, et autres
Publié: (2026)
par: Nguyen, Pham Phuong Nam, et autres
Publié: (2026)
ReFineVLA: Multimodal Reasoning-Aware Generalist Robotic Policies via Teacher-Guided Fine-Tuning
par: Van Vo, Tuan, et autres
Publié: (2026)
par: Van Vo, Tuan, et autres
Publié: (2026)
VisionKG: Unleashing the Power of Visual Datasets via Knowledge Graph
par: Yuan, Jicheng, et autres
Publié: (2023)
par: Yuan, Jicheng, et autres
Publié: (2023)
Novel sparse PCA method via Runge Kutta numerical method(s) for face recognition
par: Tran, Loc Hoang, et autres
Publié: (2025)
par: Tran, Loc Hoang, et autres
Publié: (2025)
Documents similaires
-
SepFormer: Coarse-to-fine Separator Regression Network for Table Structure Recognition
par: Nguyen, Nam Quan, et autres
Publié: (2025) -
CONSTANT: Towards High-Quality One-Shot Handwriting Generation with Patch Contrastive Enhancement and Style-Aware Quantization
par: Le, Anh-Duy, et autres
Publié: (2026) -
Facial Expression Recognition Using Residual Masking Network
par: Pham, Luan, et autres
Publié: (2026) -
Cycle Training with Semi-Supervised Domain Adaptation: Bridging Accuracy and Efficiency for Real-Time Mobile Scene Detection
par: Phan-Nguyen, Huu-Phong, et autres
Publié: (2025) -
SuMa: A Subspace Mapping Approach for Robust and Effective Concept Erasure in Text-to-Image Diffusion Models
par: Nguyen, Kien, et autres
Publié: (2025)