SCOPE: Sign Language Contextual Processing with Embedding from LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Liu, Yuqi, Zhang, Wenqian, Ren, Sihan, Huang, Chengyu, Yu, Jingyi, Xu, Lan |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
A Survey on Evaluation of Multimodal Large Language Models
par: Huang, Jiaxing, et autres
Publié: (2024)
par: Huang, Jiaxing, et autres
Publié: (2024)
iSign: A Benchmark for Indian Sign Language Processing
par: Joshi, Abhinav, et autres
Publié: (2024)
par: Joshi, Abhinav, et autres
Publié: (2024)
AutoSign: Direct Pose-to-Text Translation for Continuous Sign Language Recognition
par: Johnny, Samuel Ebimobowei, et autres
Publié: (2025)
par: Johnny, Samuel Ebimobowei, et autres
Publié: (2025)
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
par: Wang, Haochen, et autres
Publié: (2025)
par: Wang, Haochen, et autres
Publié: (2025)
Open-Vocabulary Object Detection via Language Hierarchy
par: Huang, Jiaxing, et autres
Publié: (2024)
par: Huang, Jiaxing, et autres
Publié: (2024)
3D-LEX v1.0: 3D Lexicons for American Sign Language and Sign Language of the Netherlands
par: Ranum, Oline, et autres
Publié: (2024)
par: Ranum, Oline, et autres
Publié: (2024)
LLM-PCGC: Large Language Model-based Point Cloud Geometry Compression
par: Ye, Yuqi, et autres
Publié: (2024)
par: Ye, Yuqi, et autres
Publié: (2024)
R1-SyntheticVL: Is Synthetic Data from Generative Models Ready for Multimodal Large Language Model?
par: Zhang, Jingyi, et autres
Publié: (2026)
par: Zhang, Jingyi, et autres
Publié: (2026)
SignVerse-2M: A Two-Million-Clip Pose-Native Universe of 55+ Sign Languages
par: Fang, Sen, et autres
Publié: (2026)
par: Fang, Sen, et autres
Publié: (2026)
Analyzing Diffusion and Autoregressive Vision Language Models in Multimodal Embedding Space
par: Wang, Zihang, et autres
Publié: (2026)
par: Wang, Zihang, et autres
Publié: (2026)
SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation
par: Ren, Tianfei, et autres
Publié: (2026)
par: Ren, Tianfei, et autres
Publié: (2026)
Modeling Intensification for Sign Language Generation: A Computational Approach
par: İnan, Mert, et autres
Publié: (2022)
par: İnan, Mert, et autres
Publié: (2022)
Multi-Object Hallucination in Vision-Language Models
par: Chen, Xuweiyi, et autres
Publié: (2024)
par: Chen, Xuweiyi, et autres
Publié: (2024)
RICO: Improving Accuracy and Completeness in Image Recaptioning via Visual Reconstruction
par: Wang, Yuchi, et autres
Publié: (2025)
par: Wang, Yuchi, et autres
Publié: (2025)
R2GenCSR: Mining Contextual and Residual Information for LLMs-based Radiology Report Generation
par: Wang, Xiao, et autres
Publié: (2024)
par: Wang, Xiao, et autres
Publié: (2024)
A Comprehensive Review of Sign Language Recognition: Different Types, Modalities, and Datasets
par: Madhiarasan, M., et autres
Publié: (2022)
par: Madhiarasan, M., et autres
Publié: (2022)
NoLan: Mitigating Object Hallucinations in Large Vision-Language Models via Dynamic Suppression of Language Priors
par: Ren, Lingfeng, et autres
Publié: (2026)
par: Ren, Lingfeng, et autres
Publié: (2026)
Dual-View Visual Contextualization for Web Navigation
par: Kil, Jihyung, et autres
Publié: (2024)
par: Kil, Jihyung, et autres
Publié: (2024)
A Survey on Agentic Multimodal Large Language Models
par: Yao, Huanjin, et autres
Publié: (2025)
par: Yao, Huanjin, et autres
Publié: (2025)
CSLRConformer: A Data-Centric Conformer Approach for Continuous Arabic Sign Language Recognition on the Isharah Datase
par: Elden, Fatimah Mohamed Emad
Publié: (2025)
par: Elden, Fatimah Mohamed Emad
Publié: (2025)
OMIBench: Benchmarking Olympiad-Level Multi-Image Reasoning in Large Vision-Language Model
par: Chen, Qiguang, et autres
Publié: (2026)
par: Chen, Qiguang, et autres
Publié: (2026)
SignMusketeers: An Efficient Multi-Stream Approach for Sign Language Translation at Scale
par: Gueuwou, Shester, et autres
Publié: (2024)
par: Gueuwou, Shester, et autres
Publié: (2024)
Contextual Experience Replay for Self-Improvement of Language Agents
par: Liu, Yitao, et autres
Publié: (2025)
par: Liu, Yitao, et autres
Publié: (2025)
CoViPAL: Layer-wise Contextualized Visual Token Pruning for Large Vision-Language Models
par: Tang, Zicong, et autres
Publié: (2025)
par: Tang, Zicong, et autres
Publié: (2025)
VITATECS: A Diagnostic Dataset for Temporal Concept Understanding of Video-Language Models
par: Li, Shicheng, et autres
Publié: (2023)
par: Li, Shicheng, et autres
Publié: (2023)
LLaVE: Large Language and Vision Embedding Models with Hardness-Weighted Contrastive Learning
par: Lan, Zhibin, et autres
Publié: (2025)
par: Lan, Zhibin, et autres
Publié: (2025)
Including Facial Expressions in Contextual Embeddings for Sign Language Generation
par: Viegas, Carla, et autres
Publié: (2022)
par: Viegas, Carla, et autres
Publié: (2022)
HA-FGOVD: Highlighting Fine-grained Attributes via Explicit Linear Composition for Open-Vocabulary Object Detection
par: Ma, Yuqi, et autres
Publié: (2024)
par: Ma, Yuqi, et autres
Publié: (2024)
Historical Test-time Prompt Tuning for Vision Foundation Models
par: Zhang, Jingyi, et autres
Publié: (2024)
par: Zhang, Jingyi, et autres
Publié: (2024)
SyriSign: A Parallel Corpus for Arabic Text to Syrian Arabic Sign Language Translation
par: Khalil, Mohammad Amer, et autres
Publié: (2026)
par: Khalil, Mohammad Amer, et autres
Publié: (2026)
Smart Multi-Modal Search: Contextual Sparse and Dense Embedding Integration in Adobe Express
par: Aroraa, Cherag, et autres
Publié: (2024)
par: Aroraa, Cherag, et autres
Publié: (2024)
EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
par: Du, Yiyang, et autres
Publié: (2026)
par: Du, Yiyang, et autres
Publié: (2026)
Allegory of the Cave: Measurement-Grounded Vision-Language Learning
par: Xu, Kepeng, et autres
Publié: (2026)
par: Xu, Kepeng, et autres
Publié: (2026)
Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling
par: Chen, Qiyuan, et autres
Publié: (2026)
par: Chen, Qiyuan, et autres
Publié: (2026)
Euclid: Supercharging Multimodal LLMs with Synthetic High-Fidelity Visual Descriptions
par: Zhang, Jiarui, et autres
Publié: (2024)
par: Zhang, Jiarui, et autres
Publié: (2024)
TimeChat: A Time-sensitive Multimodal Large Language Model for Long Video Understanding
par: Ren, Shuhuai, et autres
Publié: (2023)
par: Ren, Shuhuai, et autres
Publié: (2023)
Towards Privacy-Aware Sign Language Translation at Scale
par: Rust, Phillip, et autres
Publié: (2024)
par: Rust, Phillip, et autres
Publié: (2024)
Agentic Design of Compositional Machines
par: Zhang, Wenqian, et autres
Publié: (2025)
par: Zhang, Wenqian, et autres
Publié: (2025)
VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
par: Jiang, Ziyan, et autres
Publié: (2024)
par: Jiang, Ziyan, et autres
Publié: (2024)
LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants
par: Huang, Haochen, et autres
Publié: (2025)
par: Huang, Haochen, et autres
Publié: (2025)
Documents similaires
-
A Survey on Evaluation of Multimodal Large Language Models
par: Huang, Jiaxing, et autres
Publié: (2024) -
iSign: A Benchmark for Indian Sign Language Processing
par: Joshi, Abhinav, et autres
Publié: (2024) -
AutoSign: Direct Pose-to-Text Translation for Continuous Sign Language Recognition
par: Johnny, Samuel Ebimobowei, et autres
Publié: (2025) -
Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
par: Wang, Haochen, et autres
Publié: (2025) -
Open-Vocabulary Object Detection via Language Hierarchy
par: Huang, Jiaxing, et autres
Publié: (2024)