Assessing the alignment between infants' visual and linguistic experience using multimodal language models
Fuente:
arXiv
Salvato in:
| Autori principali: | Tan, Alvin Wei Ming, Yang, Jane, Sepuri, Tarun, Aw, Khai Loong, Sparks, Robert Z., Yin, Zi, Marchman, Virginia A., Frank, Michael C., Long, Bria |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Characterizing the visual representation of objects from the child's view
di: Yang, Jane, et al.
Pubblicazione: (2026)
di: Yang, Jane, et al.
Pubblicazione: (2026)
The BabyView dataset: High-resolution egocentric videos of infants' and young children's everyday experiences
di: Long, Bria, et al.
Pubblicazione: (2024)
di: Long, Bria, et al.
Pubblicazione: (2024)
DevBench: A multimodal developmental benchmark for language learning
di: Tan, Alvin Wei Ming, et al.
Pubblicazione: (2024)
di: Tan, Alvin Wei Ming, et al.
Pubblicazione: (2024)
Instruction-tuning Aligns LLMs to the Human Brain
di: Aw, Khai Loong, et al.
Pubblicazione: (2023)
di: Aw, Khai Loong, et al.
Pubblicazione: (2023)
Unified 3D Scene Understanding Through Physical World Modeling
di: Lee, Wanhee, et al.
Pubblicazione: (2026)
di: Lee, Wanhee, et al.
Pubblicazione: (2026)
3D Scene Understanding Through Local Random Access Sequence Modeling
di: Lee, Wanhee, et al.
Pubblicazione: (2025)
di: Lee, Wanhee, et al.
Pubblicazione: (2025)
Protecting multimodal large language models against misleading visualizations
di: Tonglet, Jonathan, et al.
Pubblicazione: (2025)
di: Tonglet, Jonathan, et al.
Pubblicazione: (2025)
Context informs pragmatic interpretation in vision-language models
di: Tan, Alvin Wei Ming, et al.
Pubblicazione: (2025)
di: Tan, Alvin Wei Ming, et al.
Pubblicazione: (2025)
What to align in multimodal contrastive learning?
di: Dufumier, Benoit, et al.
Pubblicazione: (2024)
di: Dufumier, Benoit, et al.
Pubblicazione: (2024)
MIMO: A medical vision language model with visual referring multimodal input and pixel grounding multimodal output
di: Chen, Yanyuan, et al.
Pubblicazione: (2025)
di: Chen, Yanyuan, et al.
Pubblicazione: (2025)
The role of translation equivalents in bilingual word learning
di: Alvin W. M. Tan, et al.
Pubblicazione: (2024)
di: Alvin W. M. Tan, et al.
Pubblicazione: (2024)
On the robustness of multimodal language model towards distractions
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
Distinct social-linguistic processing between humans and large audio-language models: Evidence from model-brain alignment
di: Wu, Hanlin, et al.
Pubblicazione: (2025)
di: Wu, Hanlin, et al.
Pubblicazione: (2025)
Is your multimodal large language model a good science tutor?
di: Liu, Ming, et al.
Pubblicazione: (2025)
di: Liu, Ming, et al.
Pubblicazione: (2025)
Large language models and linguistic intentionality
di: Grindrod, Jumbly
Pubblicazione: (2024)
di: Grindrod, Jumbly
Pubblicazione: (2024)
How desirable is alignment between LLMs and linguistically diverse human users?
di: Knoeferle, Pia, et al.
Pubblicazione: (2025)
di: Knoeferle, Pia, et al.
Pubblicazione: (2025)
A conclusive remark on linguistic theorizing and language modeling
di: Chesi, Cristiano
Pubblicazione: (2025)
di: Chesi, Cristiano
Pubblicazione: (2025)
Linguini: A benchmark for language-agnostic linguistic reasoning
di: Sánchez, Eduardo, et al.
Pubblicazione: (2024)
di: Sánchez, Eduardo, et al.
Pubblicazione: (2024)
A blind spot for large language models: Supradiegetic linguistic information
di: Zimmerman, Julia Witte, et al.
Pubblicazione: (2023)
di: Zimmerman, Julia Witte, et al.
Pubblicazione: (2023)
Zero-shot World Models Are Developmentally Efficient Learners
di: Aw, Khai Loong, et al.
Pubblicazione: (2026)
di: Aw, Khai Loong, et al.
Pubblicazione: (2026)
Evaluating Polish linguistic and cultural competency in large language models
di: Dadas, Sławomir, et al.
Pubblicazione: (2025)
di: Dadas, Sławomir, et al.
Pubblicazione: (2025)
Deaf in AI: AI language technologies and the erosion of linguistic rights
di: De Meulder, Maartje
Pubblicazione: (2025)
di: De Meulder, Maartje
Pubblicazione: (2025)
VaPR -- Vision-language Preference alignment for Reasoning
di: Wadhawan, Rohan, et al.
Pubblicazione: (2025)
di: Wadhawan, Rohan, et al.
Pubblicazione: (2025)
Closing the gap in multimodal medical representation alignment
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026)
di: Grassucci, Eleonora, et al.
Pubblicazione: (2026)
Taming generative video models for zero-shot optical flow extraction
di: Kim, Seungwoo, et al.
Pubblicazione: (2025)
di: Kim, Seungwoo, et al.
Pubblicazione: (2025)
Are formal and functional linguistic mechanisms dissociated in language models?
di: Hanna, Michael, et al.
Pubblicazione: (2025)
di: Hanna, Michael, et al.
Pubblicazione: (2025)
Do language models accommodate their users? A study of linguistic convergence
di: Blevins, Terra, et al.
Pubblicazione: (2025)
di: Blevins, Terra, et al.
Pubblicazione: (2025)
Vocabulary embeddings organize linguistic structure early in language model training
di: Papadimitriou, Isabel, et al.
Pubblicazione: (2025)
di: Papadimitriou, Isabel, et al.
Pubblicazione: (2025)
RoMemes: A multimodal meme corpus for the Romanian language
di: Păiş, Vasile, et al.
Pubblicazione: (2024)
di: Păiş, Vasile, et al.
Pubblicazione: (2024)
WorldMedQA-V: a multilingual, multimodal medical examination dataset for multimodal language models evaluation
di: Matos, João, et al.
Pubblicazione: (2024)
di: Matos, João, et al.
Pubblicazione: (2024)
GRASP: A novel benchmark for evaluating language GRounding And Situated Physics understanding in multimodal language models
di: Jassim, Serwan, et al.
Pubblicazione: (2023)
di: Jassim, Serwan, et al.
Pubblicazione: (2023)
Can multimodal representation learning by alignment preserve modality-specific information?
di: Thoreau, Romain, et al.
Pubblicazione: (2025)
di: Thoreau, Romain, et al.
Pubblicazione: (2025)
A Glass Half Full: Limitations in ChiLDES Point to Ways Forward for a More Representative Developmental Science. Commentary on Scaff et al. (2025)
di: Virginia A. Marchman, et al.
Pubblicazione: (2025)
di: Virginia A. Marchman, et al.
Pubblicazione: (2025)
Gravity Network for end-to-end small lesion detection
di: Russo, Ciro, et al.
Pubblicazione: (2023)
di: Russo, Ciro, et al.
Pubblicazione: (2023)
A solution to generalized learning from small training sets found in infant repeated visual experiences of individual objects
di: Ramirez, Frangil, et al.
Pubblicazione: (2025)
di: Ramirez, Frangil, et al.
Pubblicazione: (2025)
Phonological distances for linguistic typology and the origin of Indo-European languages
di: Mavridis, Marius, et al.
Pubblicazione: (2026)
di: Mavridis, Marius, et al.
Pubblicazione: (2026)
UF-AMA: A unified framework for cross-domain emotion recognition via adaptive multimodal alignment
di: Wang, Zheng, et al.
Pubblicazione: (2026)
di: Wang, Zheng, et al.
Pubblicazione: (2026)
Investigating the interaction of linguistic and mathematical reasoning in language models using multilingual number puzzles
di: Bhattacharya, Antara Raaghavi, et al.
Pubblicazione: (2025)
di: Bhattacharya, Antara Raaghavi, et al.
Pubblicazione: (2025)
Human-like object concept representations emerge naturally in multimodal large language models
di: Du, Changde, et al.
Pubblicazione: (2024)
di: Du, Changde, et al.
Pubblicazione: (2024)
Large-scale cloze evaluation reveals that token prediction tasks are neither lexically nor semantically aligned
di: Jacobs, Cassandra L., et al.
Pubblicazione: (2024)
di: Jacobs, Cassandra L., et al.
Pubblicazione: (2024)
Documenti analoghi
-
Characterizing the visual representation of objects from the child's view
di: Yang, Jane, et al.
Pubblicazione: (2026) -
The BabyView dataset: High-resolution egocentric videos of infants' and young children's everyday experiences
di: Long, Bria, et al.
Pubblicazione: (2024) -
DevBench: A multimodal developmental benchmark for language learning
di: Tan, Alvin Wei Ming, et al.
Pubblicazione: (2024) -
Instruction-tuning Aligns LLMs to the Human Brain
di: Aw, Khai Loong, et al.
Pubblicazione: (2023) -
Unified 3D Scene Understanding Through Physical World Modeling
di: Lee, Wanhee, et al.
Pubblicazione: (2026)