Pose Priors from Language Models
Fuente:
arXiv
Salvato in:
| Autori principali: | Subramanian, Sanjay, Ng, Evonne, Müller, Lea, Klein, Dan, Ginosar, Shiry, Darrell, Trevor |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Recursive Visual Programming
di: Ge, Jiaxin, et al.
Pubblicazione: (2023)
di: Ge, Jiaxin, et al.
Pubblicazione: (2023)
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
di: Shang, Chuyi, et al.
Pubblicazione: (2024)
di: Shang, Chuyi, et al.
Pubblicazione: (2024)
Synergy and Synchrony in Couple Dances
di: Maluleke, Vongani, et al.
Pubblicazione: (2024)
di: Maluleke, Vongani, et al.
Pubblicazione: (2024)
Poly-Autoregressive Prediction for Modeling Interactions
di: Thakkar, Neerja, et al.
Pubblicazione: (2025)
di: Thakkar, Neerja, et al.
Pubblicazione: (2025)
Which One? Leveraging Context Between Objects and Multiple Views for Language Grounding
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
Vision-Language Models Create Cross-Modal Task Representations
di: Luo, Grace, et al.
Pubblicazione: (2024)
di: Luo, Grace, et al.
Pubblicazione: (2024)
KiVA: Kid-inspired Visual Analogies for Testing Large Multimodal Models
di: Yiu, Eunice, et al.
Pubblicazione: (2024)
di: Yiu, Eunice, et al.
Pubblicazione: (2024)
AutoPresent: Designing Structured Visuals from Scratch
di: Ge, Jiaxin, et al.
Pubblicazione: (2025)
di: Ge, Jiaxin, et al.
Pubblicazione: (2025)
From Audio to Photoreal Embodiment: Synthesizing Humans in Conversations
di: Ng, Evonne, et al.
Pubblicazione: (2024)
di: Ng, Evonne, et al.
Pubblicazione: (2024)
Diffusion Models as Data Mining Tools
di: Siglidis, Ioannis, et al.
Pubblicazione: (2024)
di: Siglidis, Ioannis, et al.
Pubblicazione: (2024)
Forecasting Motion in the Wild
di: Thakkar, Neerja, et al.
Pubblicazione: (2026)
di: Thakkar, Neerja, et al.
Pubblicazione: (2026)
LLM-grounded Video Diffusion Models
di: Lian, Long, et al.
Pubblicazione: (2023)
di: Lian, Long, et al.
Pubblicazione: (2023)
Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale
di: Koepke, A. Sophia, et al.
Pubblicazione: (2026)
di: Koepke, A. Sophia, et al.
Pubblicazione: (2026)
Gaussian Masked Autoencoders
di: Rajasegaran, Jathushan, et al.
Pubblicazione: (2025)
di: Rajasegaran, Jathushan, et al.
Pubblicazione: (2025)
Dual-Process Image Generation
di: Luo, Grace, et al.
Pubblicazione: (2025)
di: Luo, Grace, et al.
Pubblicazione: (2025)
Mechanistic Finetuning of Vision-Language-Action Models via Few-Shot Demonstrations
di: Mitra, Chancharik, et al.
Pubblicazione: (2025)
di: Mitra, Chancharik, et al.
Pubblicazione: (2025)
Ham2Pose: Animating Sign Language Notation into Pose Sequences
di: Shalev-Arkushin, Rotem, et al.
Pubblicazione: (2022)
di: Shalev-Arkushin, Rotem, et al.
Pubblicazione: (2022)
Compositional Chain-of-Thought Prompting for Large Multimodal Models
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)
Person-Centric Annotations of LAION-400M: Auditing Bias and Its Transfer to Models
di: Girrbach, Leander, et al.
Pubblicazione: (2025)
di: Girrbach, Leander, et al.
Pubblicazione: (2025)
Pose-Based Sign Language Appearance Transfer
di: Moryossef, Amit, et al.
Pubblicazione: (2024)
di: Moryossef, Amit, et al.
Pubblicazione: (2024)
Enhancing Few-Shot Vision-Language Classification with Large Multimodal Model Features
di: Mitra, Chancharik, et al.
Pubblicazione: (2024)
di: Mitra, Chancharik, et al.
Pubblicazione: (2024)
Diffusion Forcing for Multi-Agent Interaction Sequence Modeling
di: Maluleke, Vongani H., et al.
Pubblicazione: (2025)
di: Maluleke, Vongani H., et al.
Pubblicazione: (2025)
Puzzled by Puzzles: When Vision-Language Models Can't Take a Hint
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
di: Lee, Heekyung, et al.
Pubblicazione: (2025)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
di: Liang, Qiao, et al.
Pubblicazione: (2025)
di: Liang, Qiao, et al.
Pubblicazione: (2025)
LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models
di: Lian, Long, et al.
Pubblicazione: (2023)
di: Lian, Long, et al.
Pubblicazione: (2023)
Revisiting the Role of Language Priors in Vision-Language Models
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
di: Lin, Zhiqiu, et al.
Pubblicazione: (2023)
Analyzing The Language of Visual Tokens
di: Chan, David M., et al.
Pubblicazione: (2024)
di: Chan, David M., et al.
Pubblicazione: (2024)
Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2026)
di: Khan, Mohammed Safi Ur Rahman, et al.
Pubblicazione: (2026)
Pose-Based Sign Language Spotting via an End-to-End Encoder Architecture
di: Johnny, Samuel Ebimobowei, et al.
Pubblicazione: (2025)
di: Johnny, Samuel Ebimobowei, et al.
Pubblicazione: (2025)
A Review on Large Language Models for Visual Analytics
di: Agarwal, Navya Sonal, et al.
Pubblicazione: (2025)
di: Agarwal, Navya Sonal, et al.
Pubblicazione: (2025)
Describing Differences in Image Sets with Natural Language
di: Dunlap, Lisa, et al.
Pubblicazione: (2023)
di: Dunlap, Lisa, et al.
Pubblicazione: (2023)
Overcoming Language Priors for Visual Question Answering Based on Knowledge Distillation
di: Peng, Daowan, et al.
Pubblicazione: (2025)
di: Peng, Daowan, et al.
Pubblicazione: (2025)
VLind-Bench: Measuring Language Priors in Large Vision-Language Models
di: Lee, Kang-il, et al.
Pubblicazione: (2024)
di: Lee, Kang-il, et al.
Pubblicazione: (2024)
Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors
di: Luo, Fuwen, et al.
Pubblicazione: (2026)
di: Luo, Fuwen, et al.
Pubblicazione: (2026)
Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation
di: Deng, Ken, et al.
Pubblicazione: (2026)
di: Deng, Ken, et al.
Pubblicazione: (2026)
Readout Guidance: Learning Control from Diffusion Features
di: Luo, Grace, et al.
Pubblicazione: (2023)
di: Luo, Grace, et al.
Pubblicazione: (2023)
DrawEduMath: Evaluating Vision Language Models with Expert-Annotated Students' Hand-Drawn Math Images
di: Baral, Sami, et al.
Pubblicazione: (2025)
di: Baral, Sami, et al.
Pubblicazione: (2025)
READ: Recurrent Adapter with Partial Video-Language Alignment for Parameter-Efficient Transfer Learning in Low-Resource Video-Language Modeling
di: Nguyen, Thong, et al.
Pubblicazione: (2023)
di: Nguyen, Thong, et al.
Pubblicazione: (2023)
DemaFormer: Damped Exponential Moving Average Transformer with Energy-Based Modeling for Temporal Language Grounding
di: Nguyen, Thong, et al.
Pubblicazione: (2023)
di: Nguyen, Thong, et al.
Pubblicazione: (2023)
From Sight to Insight: Improving Visual Reasoning Capabilities of Multimodal Models via Reinforcement Learning
di: Sharif, Omar, et al.
Pubblicazione: (2026)
di: Sharif, Omar, et al.
Pubblicazione: (2026)
Documenti analoghi
-
Recursive Visual Programming
di: Ge, Jiaxin, et al.
Pubblicazione: (2023) -
TraveLER: A Modular Multi-LMM Agent Framework for Video Question-Answering
di: Shang, Chuyi, et al.
Pubblicazione: (2024) -
Synergy and Synchrony in Couple Dances
di: Maluleke, Vongani, et al.
Pubblicazione: (2024) -
Poly-Autoregressive Prediction for Modeling Interactions
di: Thakkar, Neerja, et al.
Pubblicazione: (2025) -
Which One? Leveraging Context Between Objects and Multiple Views for Language Grounding
di: Mitra, Chancharik, et al.
Pubblicazione: (2023)