Enhancing Spoken Discourse Modeling in Language Models Using Gestural Cues
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Suresh, Varsha, Mughal, M. Hamza, Theobalt, Christian, Demberg, Vera |
|---|---|
| Format: | Preprint |
| Publié: |
2025
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Modeling Turn-Taking with Semantically Informed Gestures
par: Suresh, Varsha, et autres
Publié: (2025)
par: Suresh, Varsha, et autres
Publié: (2025)
Semantic Motion Anchors: Bridging Motion and Meaning in Co-Speech Gestures
par: Suresh, Varsha, et autres
Publié: (2026)
par: Suresh, Varsha, et autres
Publié: (2026)
MIBURI: Towards Expressive Interactive Gesture Synthesis
par: Mughal, M. Hamza, et autres
Publié: (2026)
par: Mughal, M. Hamza, et autres
Publié: (2026)
Generation-Step-Aware Framework for Cross-Modal Representation and Control in Multilingual Speech-Text Models
par: Nakai, Toshiki, et autres
Publié: (2026)
par: Nakai, Toshiki, et autres
Publié: (2026)
Synthetic Data Augmentation for Cross-domain Implicit Discourse Relation Recognition
par: Yung, Frances, et autres
Publié: (2025)
par: Yung, Frances, et autres
Publié: (2025)
Retrieving Semantics from the Deep: an RAG Solution for Gesture Synthesis
par: Mughal, M. Hamza, et autres
Publié: (2024)
par: Mughal, M. Hamza, et autres
Publié: (2024)
System-Mediated Attention Imbalances Make Vision-Language Models Say Yes
par: Chan, Tsan Tsai, et autres
Publié: (2026)
par: Chan, Tsan Tsai, et autres
Publié: (2026)
MUStReason: A Benchmark for Diagnosing Pragmatic Reasoning in Video-LMs for Multimodal Sarcasm Detection
par: Saha, Anisha, et autres
Publié: (2025)
par: Saha, Anisha, et autres
Publié: (2025)
On Crowdsourcing Task Design for Discourse Relation Annotation
par: Yung, Frances, et autres
Publié: (2024)
par: Yung, Frances, et autres
Publié: (2024)
An Adapter-Based Unified Model for Multiple Spoken Language Processing Tasks
par: Suresh, Varsha, et autres
Publié: (2024)
par: Suresh, Varsha, et autres
Publié: (2024)
GestureCoach: Rehearsing for Engaging Talks with LLM-Driven Gesture Recommendations
par: Ram, Ashwin, et autres
Publié: (2025)
par: Ram, Ashwin, et autres
Publié: (2025)
Implicit Discourse Relation Classification For Nigerian Pidgin
par: Saeed, Muhammed, et autres
Publié: (2024)
par: Saeed, Muhammed, et autres
Publié: (2024)
RST-LoRA: A Discourse-Aware Low-Rank Adaptation for Long Document Abstractive Summarization
par: Liu, Dongqi, et autres
Publié: (2024)
par: Liu, Dongqi, et autres
Publié: (2024)
Prompting Implicit Discourse Relation Annotation
par: Yung, Frances, et autres
Publié: (2024)
par: Yung, Frances, et autres
Publié: (2024)
Incorporating Distributions of Discourse Structure for Long Document Abstractive Summarization
par: Liu, Dongqi, et autres
Publié: (2023)
par: Liu, Dongqi, et autres
Publié: (2023)
MuPHI: Learning Implicit Multimodal Harm Reasoning via Semantically Grounded Reward Optimization
par: Saha, Anisha, et autres
Publié: (2026)
par: Saha, Anisha, et autres
Publié: (2026)
Explanatory Summarization with Discourse-Driven Planning
par: Liu, Dongqi, et autres
Publié: (2025)
par: Liu, Dongqi, et autres
Publié: (2025)
Human Label Variation in Implicit Discourse Relation Recognition
par: Yung, Frances, et autres
Publié: (2026)
par: Yung, Frances, et autres
Publié: (2026)
The Design of Informative Take-Over Requests for Semi-Autonomous Cyber-Physical Systems: Combining Spoken Language and Visual Icons in a Drone-Controller Setting
par: Gundappa, Ashwini, et autres
Publié: (2024)
par: Gundappa, Ashwini, et autres
Publié: (2024)
Human Speech Perception in Noise: Can Large Language Models Paraphrase to Improve It?
par: Chingacham, Anupama, et autres
Publié: (2024)
par: Chingacham, Anupama, et autres
Publié: (2024)
ConvoFusion: Multi-Modal Conversational Diffusion for Co-Speech Gesture Synthesis
par: Mughal, Muhammad Hamza, et autres
Publié: (2024)
par: Mughal, Muhammad Hamza, et autres
Publié: (2024)
RSA-Control: A Pragmatics-Grounded Lightweight Controllable Text Generation Framework
par: Wang, Yifan, et autres
Publié: (2024)
par: Wang, Yifan, et autres
Publié: (2024)
ChatGPT vs Human-authored Text: Insights into Controllable Text Summarization and Sentence Style Transfer
par: Liu, Dongqi, et autres
Publié: (2023)
par: Liu, Dongqi, et autres
Publié: (2023)
LLMs syntactically adapt their language use to their conversational partner
par: Kandra, Florian, et autres
Publié: (2025)
par: Kandra, Florian, et autres
Publié: (2025)
B-cos LM: Efficiently Transforming Pre-trained Language Models for Improved Explainability
par: Wang, Yifan, et autres
Publié: (2025)
par: Wang, Yifan, et autres
Publié: (2025)
Modeling Orthographic Variation Improves NLP Performance for Nigerian Pidgin
par: Lin, Pin-Jie, et autres
Publié: (2024)
par: Lin, Pin-Jie, et autres
Publié: (2024)
Paralinguistics-Enhanced Large Language Modeling of Spoken Dialogue
par: Lin, Guan-Ting, et autres
Publié: (2023)
par: Lin, Guan-Ting, et autres
Publié: (2023)
Is Cross-Lingual Transfer in Bilingual Models Human-Like? A Study with Overlapping Word Forms in Dutch and English
par: Škrjanec, Iza, et autres
Publié: (2026)
par: Škrjanec, Iza, et autres
Publié: (2026)
Probing Language Models' Gesture Understanding for Enhanced Human-AI Interaction
par: Wicke, Philipp
Publié: (2024)
par: Wicke, Philipp
Publié: (2024)
Temperature-scaling surprisal estimates improve fit to human reading times -- but does it do so for the "right reasons"?
par: Liu, Tong, et autres
Publié: (2023)
par: Liu, Tong, et autres
Publié: (2023)
Bias in LLMs as Annotators: The Effect of Party Cues on Labelling Decision by Large Language Models
par: Vera, Sebastian Vallejo, et autres
Publié: (2024)
par: Vera, Sebastian Vallejo, et autres
Publié: (2024)
GmSLM : Generative Marmoset Spoken Language Modeling
par: Sternberg, Talia, et autres
Publié: (2025)
par: Sternberg, Talia, et autres
Publié: (2025)
Large Language Models for Expansion of Spoken Language Understanding Systems to New Languages
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
par: Hoscilowicz, Jakub, et autres
Publié: (2024)
How Language Models Prioritize Contextual Grammatical Cues?
par: Amirzadeh, Hamidreza, et autres
Publié: (2024)
par: Amirzadeh, Hamidreza, et autres
Publié: (2024)
Towards Hierarchical Spoken Language Dysfluency Modeling
par: Lian, Jiachen, et autres
Publié: (2024)
par: Lian, Jiachen, et autres
Publié: (2024)
Discourse-Aware Dual-Track Streaming Response for Low-Latency Spoken Dialogue Systems
par: Liu, Siyuan, et autres
Publié: (2026)
par: Liu, Siyuan, et autres
Publié: (2026)
Transcribe, Translate, or Transliterate: An Investigation of Intermediate Representations in Spoken Language Models
par: Ògúnrèmí, Tolúlopé, et autres
Publié: (2025)
par: Ògúnrèmí, Tolúlopé, et autres
Publié: (2025)
Evaluating Multimodal Large Language Models on Spoken Sarcasm Understanding
par: Li, Zhu, et autres
Publié: (2025)
par: Li, Zhu, et autres
Publié: (2025)
Spoken Language Identification with Pre-trained Models and Margin Loss
par: Fang, Zhihua, et autres
Publié: (2026)
par: Fang, Zhihua, et autres
Publié: (2026)
Large Language Models for Virtual Human Gesture Selection
par: Torshizi, Parisa Ghanad, et autres
Publié: (2025)
par: Torshizi, Parisa Ghanad, et autres
Publié: (2025)
Documents similaires
-
Modeling Turn-Taking with Semantically Informed Gestures
par: Suresh, Varsha, et autres
Publié: (2025) -
Semantic Motion Anchors: Bridging Motion and Meaning in Co-Speech Gestures
par: Suresh, Varsha, et autres
Publié: (2026) -
MIBURI: Towards Expressive Interactive Gesture Synthesis
par: Mughal, M. Hamza, et autres
Publié: (2026) -
Generation-Step-Aware Framework for Cross-Modal Representation and Control in Multilingual Speech-Text Models
par: Nakai, Toshiki, et autres
Publié: (2026) -
Synthetic Data Augmentation for Cross-domain Implicit Discourse Relation Recognition
par: Yung, Frances, et autres
Publié: (2025)