Bridging the Gap between Text, Audio, Image, and Any Sequence: A Novel Approach using Gloss-based Annotation
Fuente:
arXiv
Saved in:
| Main Authors: | Fang, Sen, Chen, Sizhou, Feng, Yalin, Zhang, Xiaofeng, Teoh, Teik Toe |
|---|---|
| Format: | Preprint |
| Published: |
2024
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Stacking-Enhanced Bagging Ensemble Learning for Breast Cancer Classification with CNN
by: Wu, Peihceng, et al.
Published: (2024)
by: Wu, Peihceng, et al.
Published: (2024)
Gloss2Text: Sign Language Gloss translation using LLMs and Semantically Aware Label Smoothing
by: Fayyazsanavi, Pooya, et al.
Published: (2024)
by: Fayyazsanavi, Pooya, et al.
Published: (2024)
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
by: Liu, Yunze, et al.
Published: (2026)
by: Liu, Yunze, et al.
Published: (2026)
Bridge the Gap between SNN and ANN for Image Restoration
by: Su, Xin, et al.
Published: (2025)
by: Su, Xin, et al.
Published: (2025)
Bridging Sign and Spoken Languages: Pseudo Gloss Generation for Sign Language Translation
by: Guo, Jianyuan, et al.
Published: (2025)
by: Guo, Jianyuan, et al.
Published: (2025)
Bridging the Modality Gap: Dimension Information Alignment and Sparse Spatial Constraint for Image-Text Matching
by: Ma, Xiang, et al.
Published: (2024)
by: Ma, Xiang, et al.
Published: (2024)
Bridging the Gap: Aligning Text-to-Image Diffusion Models with Specific Feedback
by: Niu, Xuexiang, et al.
Published: (2024)
by: Niu, Xuexiang, et al.
Published: (2024)
Beyond Gloss: A Hand-Centric Framework for Gloss-Free Sign Language Translation
by: Asasi, Sobhan, et al.
Published: (2025)
by: Asasi, Sobhan, et al.
Published: (2025)
RAC: Rectified Flow Auto Coder
by: Fang, Sen, et al.
Published: (2026)
by: Fang, Sen, et al.
Published: (2026)
Bridging Annotation Gaps: Transferring Labels to Align Object Detection Datasets
by: Kennerley, Mikhail, et al.
Published: (2025)
by: Kennerley, Mikhail, et al.
Published: (2025)
AnyTrans: Translate AnyText in the Image with Large Scale Models
by: Qian, Zhipeng, et al.
Published: (2024)
by: Qian, Zhipeng, et al.
Published: (2024)
StreamFlow: Theory, Algorithm, and Implementation for High-Efficiency Rectified Flow Generation
by: Fang, Sen, et al.
Published: (2025)
by: Fang, Sen, et al.
Published: (2025)
AnyImageNav: Any-View Geometry for Precise Last-Meter Image-Goal Navigation
by: Deng, Yijie, et al.
Published: (2026)
by: Deng, Yijie, et al.
Published: (2026)
Autoregressive Sign Language Production: A Gloss-Free Approach with Discrete Representations
by: Hwang, Eui Jun, et al.
Published: (2023)
by: Hwang, Eui Jun, et al.
Published: (2023)
Face Anything: 4D Face Reconstruction from Any Image Sequence
by: Kocasari, Umut, et al.
Published: (2026)
by: Kocasari, Umut, et al.
Published: (2026)
Bridge to Non-Barrier Communication: Gloss-Prompted Fine-grained Cued Speech Gesture Generation with Diffusion Model
by: Lei, Wentao, et al.
Published: (2024)
by: Lei, Wentao, et al.
Published: (2024)
Category-level Text-to-Image Retrieval Improved: Bridging the Domain Gap with Diffusion Models and Vision Encoders
by: Khan, Faizan Farooq, et al.
Published: (2025)
by: Khan, Faizan Farooq, et al.
Published: (2025)
Bridging Visual Affective Gap: Borrowing Textual Knowledge by Learning from Noisy Image-Text Pairs
by: Wu, Daiqing, et al.
Published: (2025)
by: Wu, Daiqing, et al.
Published: (2025)
Text-Printed Image: Bridging the Image-Text Modality Gap for Text-centric Training of Large Vision-Language Models
by: Yamabe, Shojiro, et al.
Published: (2025)
by: Yamabe, Shojiro, et al.
Published: (2025)
AnyAD: Unified Any-Modality Anomaly Detection in Incomplete Multi-Sequence MRI
by: Wu, Changwei, et al.
Published: (2025)
by: Wu, Changwei, et al.
Published: (2025)
Enhancing Semantic Fidelity in Text-to-Image Synthesis: Attention Regulation in Diffusion Models
by: Zhang, Yang, et al.
Published: (2024)
by: Zhang, Yang, et al.
Published: (2024)
Bridging the Gap Between End-to-End and Two-Step Text Spotting
by: Huang, Mingxin, et al.
Published: (2024)
by: Huang, Mingxin, et al.
Published: (2024)
Bridging the Perception Gap in Image Super-Resolution Evaluation
by: Su, Shaolin, et al.
Published: (2025)
by: Su, Shaolin, et al.
Published: (2025)
Text as Any-Modality for Zero-Shot Classification by Consistent Prompt Tuning
by: Wu, Xiangyu, et al.
Published: (2025)
by: Wu, Xiangyu, et al.
Published: (2025)
Text-Promptable Propagation for Referring Medical Image Sequence Segmentation
by: Yuan, Runtian, et al.
Published: (2025)
by: Yuan, Runtian, et al.
Published: (2025)
OpenBox: Annotate Any Bounding Boxes in 3D
by: Lee, In-Jae, et al.
Published: (2025)
by: Lee, In-Jae, et al.
Published: (2025)
AnyText: Multilingual Visual Text Generation And Editing
by: Tuo, Yuxiang, et al.
Published: (2023)
by: Tuo, Yuxiang, et al.
Published: (2023)
AnyControl: Create Your Artwork with Versatile Control on Text-to-Image Generation
by: Sun, Yanan, et al.
Published: (2024)
by: Sun, Yanan, et al.
Published: (2024)
Unaligning Everything: Or Aligning Any Text to Any Image in Multimodal Models
by: Salman, Shaeke, et al.
Published: (2024)
by: Salman, Shaeke, et al.
Published: (2024)
A Novel Unified Approach to Deepfake Detection
by: Sen, Lord, et al.
Published: (2026)
by: Sen, Lord, et al.
Published: (2026)
QUOTA: Quantifying Objects with Text-to-Image Models for Any Domain
by: Sun, Wenfang, et al.
Published: (2024)
by: Sun, Wenfang, et al.
Published: (2024)
Bridging the Intention-Expression Gap: Aligning Multi-Dimensional Preferences via Hierarchical Relevance Feedback in Text-to-Image Diffusion
by: Wang, Wenxi, et al.
Published: (2026)
by: Wang, Wenxi, et al.
Published: (2026)
Dereflection Any Image with Diffusion Priors and Diversified Data
by: Hu, Jichen, et al.
Published: (2025)
by: Hu, Jichen, et al.
Published: (2025)
Stable Signer: Hierarchical Sign Language Generative Model
by: Fang, Sen, et al.
Published: (2025)
by: Fang, Sen, et al.
Published: (2025)
Remember Me: Bridging the Long-Range Gap in LVLMs with Three-Step Inference-Only Decay Resilience Strategies
by: Gao, Peng, et al.
Published: (2025)
by: Gao, Peng, et al.
Published: (2025)
Hierarchical Feature Alignment for Gloss-Free Sign Language Translation
by: Asasi, Sobhan, et al.
Published: (2025)
by: Asasi, Sobhan, et al.
Published: (2025)
Predicting Perceived Gloss: Do Weak Labels Suffice?
by: Guerrero-Viu, Julia, et al.
Published: (2024)
by: Guerrero-Viu, Julia, et al.
Published: (2024)
AnyStory: Towards Unified Single and Multiple Subject Personalization in Text-to-Image Generation
by: He, Junjie, et al.
Published: (2025)
by: He, Junjie, et al.
Published: (2025)
TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning
by: Kim, Seongah, et al.
Published: (2026)
by: Kim, Seongah, et al.
Published: (2026)
Bridging the Skeleton-Text Modality Gap: Diffusion-Powered Modality Alignment for Zero-shot Skeleton-based Action Recognition
by: Do, Jeonghyeok, et al.
Published: (2024)
by: Do, Jeonghyeok, et al.
Published: (2024)
Similar Items
-
Stacking-Enhanced Bagging Ensemble Learning for Breast Cancer Classification with CNN
by: Wu, Peihceng, et al.
Published: (2024) -
Gloss2Text: Sign Language Gloss translation using LLMs and Semantically Aware Label Smoothing
by: Fayyazsanavi, Pooya, et al.
Published: (2024) -
OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation
by: Liu, Yunze, et al.
Published: (2026) -
Bridge the Gap between SNN and ANN for Image Restoration
by: Su, Xin, et al.
Published: (2025) -
Bridging Sign and Spoken Languages: Pseudo Gloss Generation for Sign Language Translation
by: Guo, Jianyuan, et al.
Published: (2025)