Semi-Supervised Spoken Language Glossification
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Yao, Huijie, Zhou, Wengang, Zhou, Hao, Li, Houqiang |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
Robust Multimodal Large Language Models Against Modality Conflict
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2025)
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2025)
Cross-Lingual Transfer for Natural Language Inference via Multilingual Prompt Translator
von: Qiu, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Qiu, Xiaoyu, et al.
Veröffentlicht: (2024)
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
von: Sun, Qi, et al.
Veröffentlicht: (2024)
von: Sun, Qi, et al.
Veröffentlicht: (2024)
P-RAG: Progressive Retrieval Augmented Generation For Planning on Embodied Everyday Task
von: Xu, Weiye, et al.
Veröffentlicht: (2024)
von: Xu, Weiye, et al.
Veröffentlicht: (2024)
Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models
von: Cui, Xiao, et al.
Veröffentlicht: (2024)
von: Cui, Xiao, et al.
Veröffentlicht: (2024)
BoolQuestions: Does Dense Retrieval Understand Boolean Logic in Language?
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2024)
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2024)
Trustworthy Alignment of Retrieval-Augmented Large Language Models via Reinforcement Learning
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2024)
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2024)
Revisiting Shadow Detection from a Vision-Language Perspective
von: Wang, Yonghui, et al.
Veröffentlicht: (2026)
von: Wang, Yonghui, et al.
Veröffentlicht: (2026)
Self-Supervised Representation Learning with Spatial-Temporal Consistency for Sign Language Recognition
von: Zhao, Weichao, et al.
Veröffentlicht: (2024)
von: Zhao, Weichao, et al.
Veröffentlicht: (2024)
Disentangling Length Bias In Preference Learning Via Response-Conditioned Modeling
von: Cai, Jianfeng, et al.
Veröffentlicht: (2025)
von: Cai, Jianfeng, et al.
Veröffentlicht: (2025)
AdaptVision: Dynamic Input Scaling in MLLMs for Versatile Scene Understanding
von: Wang, Yonghui, et al.
Veröffentlicht: (2024)
von: Wang, Yonghui, et al.
Veröffentlicht: (2024)
Self-Classification Enhancement and Correction for Weakly Supervised Object Detection
von: Yin, Yufei, et al.
Veröffentlicht: (2025)
von: Yin, Yufei, et al.
Veröffentlicht: (2025)
Flow-SLM: Joint Learning of Linguistic and Acoustic Information for Spoken Language Modeling
von: Chou, Ju-Chieh, et al.
Veröffentlicht: (2025)
von: Chou, Ju-Chieh, et al.
Veröffentlicht: (2025)
Spoken Language Modeling with Duration-Penalized Self-Supervised Units
von: Visser, Nicol, et al.
Veröffentlicht: (2025)
von: Visser, Nicol, et al.
Veröffentlicht: (2025)
DEBISS: a Corpus of Individual, Semi-structured and Spoken Debates
von: de Souza, Klaywert Danillo Ferreira, et al.
Veröffentlicht: (2026)
von: de Souza, Klaywert Danillo Ferreira, et al.
Veröffentlicht: (2026)
SEDS: Semantically Enhanced Dual-Stream Encoder for Sign Language Retrieval
von: Jiang, Longtao, et al.
Veröffentlicht: (2024)
von: Jiang, Longtao, et al.
Veröffentlicht: (2024)
Cross-Modal Consistency Learning for Sign Language Recognition
von: Wu, Kepeng, et al.
Veröffentlicht: (2025)
von: Wu, Kepeng, et al.
Veröffentlicht: (2025)
Video-based Sign Language Recognition without Temporal Segmentation
von: Huang, Jie, et al.
Veröffentlicht: (2018)
von: Huang, Jie, et al.
Veröffentlicht: (2018)
Multi-Cue Adaptive Visual Token Pruning for Large Vision-Language Models
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
von: Luan, Bozhi, et al.
Veröffentlicht: (2025)
Sinkhorn Distance Minimization for Knowledge Distillation
von: Cui, Xiao, et al.
Veröffentlicht: (2024)
von: Cui, Xiao, et al.
Veröffentlicht: (2024)
Scaling up Multimodal Pre-training for Sign Language Understanding
von: Zhou, Wengang, et al.
Veröffentlicht: (2024)
von: Zhou, Wengang, et al.
Veröffentlicht: (2024)
A Tale of Two Languages: Large-Vocabulary Continuous Sign Language Recognition from Spoken Language Supervision
von: Raude, Charles, et al.
Veröffentlicht: (2024)
von: Raude, Charles, et al.
Veröffentlicht: (2024)
Semi-Supervised Synthetic Data Generation with Fine-Grained Relevance Control for Short Video Search Relevance Modeling
von: Li, Haoran, et al.
Veröffentlicht: (2025)
von: Li, Haoran, et al.
Veröffentlicht: (2025)
LaneTCA: Enhancing Video Lane Detection with Temporal Context Aggregation
von: Zhou, Keyi, et al.
Veröffentlicht: (2024)
von: Zhou, Keyi, et al.
Veröffentlicht: (2024)
FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs
von: Hong, Yun, et al.
Veröffentlicht: (2026)
von: Hong, Yun, et al.
Veröffentlicht: (2026)
GaussNav: Gaussian Splatting for Visual Navigation
von: Lei, Xiaohan, et al.
Veröffentlicht: (2024)
von: Lei, Xiaohan, et al.
Veröffentlicht: (2024)
MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning
von: Liu, Xiaoyang, et al.
Veröffentlicht: (2024)
von: Liu, Xiaoyang, et al.
Veröffentlicht: (2024)
StepVAR: Structure-Texture Guided Pruning for Visual Autoregressive Models
von: Liu, Keli, et al.
Veröffentlicht: (2026)
von: Liu, Keli, et al.
Veröffentlicht: (2026)
CroPrompt: Cross-task Interactive Prompting for Zero-shot Spoken Language Understanding
von: Qin, Libo, et al.
Veröffentlicht: (2024)
von: Qin, Libo, et al.
Veröffentlicht: (2024)
Progressive Multi-modal Conditional Prompt Tuning
von: Qiu, Xiaoyu, et al.
Veröffentlicht: (2024)
von: Qiu, Xiaoyu, et al.
Veröffentlicht: (2024)
RoFIR: Robust Fisheye Image Rectification Framework Impervious to Optical Center Deviation
von: Liao, Zhaokang, et al.
Veröffentlicht: (2024)
von: Liao, Zhaokang, et al.
Veröffentlicht: (2024)
Forest2Seq: Revitalizing Order Prior for Sequential Indoor Scene Synthesis
von: Sun, Qi, et al.
Veröffentlicht: (2024)
von: Sun, Qi, et al.
Veröffentlicht: (2024)
Multi-Intent Spoken Language Understanding: Methods, Trends, and Challenges
von: Wu, Di, et al.
Veröffentlicht: (2025)
von: Wu, Di, et al.
Veröffentlicht: (2025)
VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing
von: Xu, Jiacheng, et al.
Veröffentlicht: (2026)
von: Xu, Jiacheng, et al.
Veröffentlicht: (2026)
MAC-SLU: Multi-Intent Automotive Cabin Spoken Language Understanding Benchmark
von: Peng, Yuezhang, et al.
Veröffentlicht: (2025)
von: Peng, Yuezhang, et al.
Veröffentlicht: (2025)
GmSLM : Generative Marmoset Spoken Language Modeling
von: Sternberg, Talia, et al.
Veröffentlicht: (2025)
von: Sternberg, Talia, et al.
Veröffentlicht: (2025)
Large Language Models for Depression Recognition in Spoken Language Integrating Psychological Knowledge
von: Li, Yupei, et al.
Veröffentlicht: (2025)
von: Li, Yupei, et al.
Veröffentlicht: (2025)
Geolocation-Aware Robust Spoken Language Identification
von: Wang, Qingzheng, et al.
Veröffentlicht: (2025)
von: Wang, Qingzheng, et al.
Veröffentlicht: (2025)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
von: Li, Zhu, et al.
Veröffentlicht: (2025)
von: Li, Zhu, et al.
Veröffentlicht: (2025)
SpidR: Learning Fast and Stable Linguistic Units for Spoken Language Models Without Supervision
von: Poli, Maxime, et al.
Veröffentlicht: (2025)
von: Poli, Maxime, et al.
Veröffentlicht: (2025)
Ähnliche Einträge
-
Robust Multimodal Large Language Models Against Modality Conflict
von: Zhang, Zongmeng, et al.
Veröffentlicht: (2025) -
Cross-Lingual Transfer for Natural Language Inference via Multilingual Prompt Translator
von: Qiu, Xiaoyu, et al.
Veröffentlicht: (2024) -
Exploiting GPT-4 Vision for Zero-shot Point Cloud Understanding
von: Sun, Qi, et al.
Veröffentlicht: (2024) -
P-RAG: Progressive Retrieval Augmented Generation For Planning on Embodied Everyday Task
von: Xu, Weiye, et al.
Veröffentlicht: (2024) -
Multi-Level Optimal Transport for Universal Cross-Tokenizer Knowledge Distillation on Language Models
von: Cui, Xiao, et al.
Veröffentlicht: (2024)