Enhancing Visual Forced Alignment with Local Context-Aware Feature Extraction and Multi-Task Learning
Fuente:
arXiv
Salvato in:
| Autori principali: | He, Yi, Yang, Lei, Wang, Shilin |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
di: Yang, Lei, et al.
Pubblicazione: (2026)
di: Yang, Lei, et al.
Pubblicazione: (2026)
Landmark Guided Visual Feature Extractor for Visual Speech Recognition with Limited Resource
di: Yang, Lei, et al.
Pubblicazione: (2025)
di: Yang, Lei, et al.
Pubblicazione: (2025)
PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment
di: Luo, Tianci, et al.
Pubblicazione: (2026)
di: Luo, Tianci, et al.
Pubblicazione: (2026)
Enhancing Visual In-Context Learning by Multi-Faceted Fusion
di: Liao, Wenwen, et al.
Pubblicazione: (2026)
di: Liao, Wenwen, et al.
Pubblicazione: (2026)
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
di: He, Xiang, et al.
Pubblicazione: (2025)
di: He, Xiang, et al.
Pubblicazione: (2025)
GMC: A General Framework of Multi-stage Context Learning and Utilization for Visual Detection Tasks
di: Wang, Xuan, et al.
Pubblicazione: (2024)
di: Wang, Xuan, et al.
Pubblicazione: (2024)
GraphAlign: Enhancing Accurate Feature Alignment by Graph matching for Multi-Modal 3D Object Detection
di: Song, Ziying, et al.
Pubblicazione: (2023)
di: Song, Ziying, et al.
Pubblicazione: (2023)
Local-Global Context Aware Transformer for Language-Guided Video Segmentation
di: Liang, Chen, et al.
Pubblicazione: (2022)
di: Liang, Chen, et al.
Pubblicazione: (2022)
Mamba Learns in Context: Structure-Aware Domain Generalization for Multi-Task Point Cloud Understanding
di: Jiang, Jincen, et al.
Pubblicazione: (2026)
di: Jiang, Jincen, et al.
Pubblicazione: (2026)
Enhancing Continual Learning in Visual Question Answering with Modality-Aware Feature Distillation
di: Nikandrou, Malvina, et al.
Pubblicazione: (2024)
di: Nikandrou, Malvina, et al.
Pubblicazione: (2024)
UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation
di: Huang, Jiehui, et al.
Pubblicazione: (2025)
di: Huang, Jiehui, et al.
Pubblicazione: (2025)
Omni-AD: Learning to Reconstruct Global and Local Features for Multi-class Anomaly Detection
di: Quan, Jiajie, et al.
Pubblicazione: (2025)
di: Quan, Jiajie, et al.
Pubblicazione: (2025)
Learning Prompt-Enhanced Context Features for Weakly-Supervised Video Anomaly Detection
di: Pu, Yujiang, et al.
Pubblicazione: (2023)
di: Pu, Yujiang, et al.
Pubblicazione: (2023)
Recurrent Visual Feature Extraction and Stereo Attentions for CT Report Generation
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
di: Tian, Yuanhe, et al.
Pubblicazione: (2025)
Localization-Aware Multi-Scale Representation Learning for Repetitive Action Counting
di: Wang, Sujia, et al.
Pubblicazione: (2025)
di: Wang, Sujia, et al.
Pubblicazione: (2025)
Unifying Visual and Semantic Feature Spaces with Diffusion Models for Enhanced Cross-Modal Alignment
di: Zheng, Yuze, et al.
Pubblicazione: (2024)
di: Zheng, Yuze, et al.
Pubblicazione: (2024)
Leveraging Spatial Attention and Edge Context for Optimized Feature Selection in Visual Localization
di: Istighfarin, Nanda Febri, et al.
Pubblicazione: (2024)
di: Istighfarin, Nanda Febri, et al.
Pubblicazione: (2024)
GESS: Multi-cue Guided Local Feature Learning via Geometric and Semantic Synergy
di: Yi, Yang, et al.
Pubblicazione: (2026)
di: Yi, Yang, et al.
Pubblicazione: (2026)
Explainable Pathomics Feature Visualization via Correlation-aware Conditional Feature Editing
di: Yang, Yuechen, et al.
Pubblicazione: (2026)
di: Yang, Yuechen, et al.
Pubblicazione: (2026)
Enhanced Textual Feature Extraction for Visual Question Answering: A Simple Convolutional Approach
di: Zhang, Zhilin, et al.
Pubblicazione: (2024)
di: Zhang, Zhilin, et al.
Pubblicazione: (2024)
Is Visual in-Context Learning for Compositional Medical Tasks within Reach?
di: Reiß, Simon, et al.
Pubblicazione: (2025)
di: Reiß, Simon, et al.
Pubblicazione: (2025)
MC-Bench: A Benchmark for Multi-Context Visual Grounding in the Era of MLLMs
di: Xu, Yunqiu, et al.
Pubblicazione: (2024)
di: Xu, Yunqiu, et al.
Pubblicazione: (2024)
Task-Oriented Human Grasp Synthesis via Context- and Task-Aware Diffusers
di: Liu, An-Lun, et al.
Pubblicazione: (2025)
di: Liu, An-Lun, et al.
Pubblicazione: (2025)
Context-Based Semantic-Aware Alignment for Semi-Supervised Multi-Label Learning
di: Fan, Heng-Bo, et al.
Pubblicazione: (2024)
di: Fan, Heng-Bo, et al.
Pubblicazione: (2024)
Image Classification via Random Dilated Convolution with Multi-Branch Feature Extraction and Context Excitation
di: Jiang, Wentao, et al.
Pubblicazione: (2026)
di: Jiang, Wentao, et al.
Pubblicazione: (2026)
Efficient Large Multi-modal Models via Visual Context Compression
di: Chen, Jieneng, et al.
Pubblicazione: (2024)
di: Chen, Jieneng, et al.
Pubblicazione: (2024)
Semantic Aware Feature Extraction for Enhanced 3D Reconstruction
di: Nap, Ronald, et al.
Pubblicazione: (2026)
di: Nap, Ronald, et al.
Pubblicazione: (2026)
Rethinking Where to Edit: Task-Aware Localization for Instruction-Based Image Editing
di: He, Jingxuan, et al.
Pubblicazione: (2026)
di: He, Jingxuan, et al.
Pubblicazione: (2026)
SOUPLE: Enhancing Audio-Visual Localization and Segmentation with Learnable Prompt Contexts
di: Nguyen, Khanh Binh, et al.
Pubblicazione: (2026)
di: Nguyen, Khanh Binh, et al.
Pubblicazione: (2026)
Unsupervised Learning for Feature Extraction and Temporal Alignment of 3D+t Point Clouds of Zebrafish Embryos
di: Chen, Zhu, et al.
Pubblicazione: (2025)
di: Chen, Zhu, et al.
Pubblicazione: (2025)
Feature-Based Dual Visual Feature Extraction Model for Compound Multimodal Emotion Recognition
di: Liu, Ran, et al.
Pubblicazione: (2025)
di: Liu, Ran, et al.
Pubblicazione: (2025)
OTTER: A Vision-Language-Action Model with Text-Aware Visual Feature Extraction
di: Huang, Huang, et al.
Pubblicazione: (2025)
di: Huang, Huang, et al.
Pubblicazione: (2025)
Toward Real-Time Edge AI: Model-Agnostic Task-Oriented Communication with Visual Feature Alignment
di: Xie, Songjie, et al.
Pubblicazione: (2024)
di: Xie, Songjie, et al.
Pubblicazione: (2024)
DVLO: Deep Visual-LiDAR Odometry with Local-to-Global Feature Fusion and Bi-Directional Structure Alignment
di: Liu, Jiuming, et al.
Pubblicazione: (2024)
di: Liu, Jiuming, et al.
Pubblicazione: (2024)
LoDisc: Learning Global-Local Discriminative Features for Self-Supervised Fine-Grained Visual Recognition
di: Shi, Jialu, et al.
Pubblicazione: (2024)
di: Shi, Jialu, et al.
Pubblicazione: (2024)
Context-Aware Multi-Turn Visual-Textual Reasoning in LVLMs via Dynamic Memory and Adaptive Visual Guidance
di: Shen, Weijie, et al.
Pubblicazione: (2025)
di: Shen, Weijie, et al.
Pubblicazione: (2025)
USDRL: Unified Skeleton-Based Dense Representation Learning with Multi-Grained Feature Decorrelation
di: Weng, Wanjiang, et al.
Pubblicazione: (2024)
di: Weng, Wanjiang, et al.
Pubblicazione: (2024)
Revisiting Multi-Task Visual Representation Learning
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
di: Di, Shangzhe, et al.
Pubblicazione: (2026)
Task Preference Optimization: Improving Multimodal Large Language Models with Vision Task Alignment
di: Yan, Ziang, et al.
Pubblicazione: (2024)
di: Yan, Ziang, et al.
Pubblicazione: (2024)
Visual Gyroscope: Combination of Deep Learning Features and Direct Alignment for Panoramic Stabilization
di: Berenguel-Baeta, Bruno, et al.
Pubblicazione: (2024)
di: Berenguel-Baeta, Bruno, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cascade-Free Mandarin Visual Speech Recognition via Semantic-Guided Cross-Representation Alignment
di: Yang, Lei, et al.
Pubblicazione: (2026) -
Landmark Guided Visual Feature Extractor for Visual Speech Recognition with Limited Resource
di: Yang, Lei, et al.
Pubblicazione: (2025) -
PromptHub: Enhancing Multi-Prompt Visual In-Context Learning with Locality-Aware Fusion, Concentration and Alignment
di: Luo, Tianci, et al.
Pubblicazione: (2026) -
Enhancing Visual In-Context Learning by Multi-Faceted Fusion
di: Liao, Wenwen, et al.
Pubblicazione: (2026) -
Enhancing Audio-Visual Spiking Neural Networks through Semantic-Alignment and Cross-Modal Residual Learning
di: He, Xiang, et al.
Pubblicazione: (2025)