One fish, two fish, but not the whole sea: Alignment reduces language models' conceptual diversity
Fuente:
arXiv
Salvato in:
| Autori principali: | Murthy, Sonia K., Ullman, Tomer, Hu, Jennifer |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Cognitive models can reveal interpretable value trade-offs in language models
di: Murthy, Sonia K., et al.
Pubblicazione: (2025)
di: Murthy, Sonia K., et al.
Pubblicazione: (2025)
Re-evaluating Theory of Mind evaluation in large language models
di: Hu, Jennifer, et al.
Pubblicazione: (2025)
di: Hu, Jennifer, et al.
Pubblicazione: (2025)
Shades of Zero: Distinguishing Impossibility from Inconceivability
di: Hu, Jennifer, et al.
Pubblicazione: (2025)
di: Hu, Jennifer, et al.
Pubblicazione: (2025)
The Illusion-Illusion: Vision Language Models See Illusions Where There are None
di: Ullman, Tomer
Pubblicazione: (2024)
di: Ullman, Tomer
Pubblicazione: (2024)
Relations, Negations, and Numbers: Looking for Logic in Generative Text-to-Image Models
di: Conwell, Colin, et al.
Pubblicazione: (2024)
di: Conwell, Colin, et al.
Pubblicazione: (2024)
Forking Paths in Neural Text Generation
di: Bigelow, Eric, et al.
Pubblicazione: (2024)
di: Bigelow, Eric, et al.
Pubblicazione: (2024)
Auxiliary task demands mask the capabilities of smaller language models
di: Hu, Jennifer, et al.
Pubblicazione: (2024)
di: Hu, Jennifer, et al.
Pubblicazione: (2024)
Lost without translation -- Can transformer (language models) understand mood states?
di: Shivaprakash, Prakrithi, et al.
Pubblicazione: (2025)
di: Shivaprakash, Prakrithi, et al.
Pubblicazione: (2025)
Simple synthetic data reduces sycophancy in large language models
di: Wei, Jerry, et al.
Pubblicazione: (2023)
di: Wei, Jerry, et al.
Pubblicazione: (2023)
Identifying and interpreting non-aligned human conceptual representations using language modeling
di: Bao, Wanqian, et al.
Pubblicazione: (2024)
di: Bao, Wanqian, et al.
Pubblicazione: (2024)
Alignment faking in large language models
di: Greenblatt, Ryan, et al.
Pubblicazione: (2024)
di: Greenblatt, Ryan, et al.
Pubblicazione: (2024)
Code-enabled language models can outperform reasoning models on diverse tasks
di: Zhang, Cedegao E., et al.
Pubblicazione: (2025)
di: Zhang, Cedegao E., et al.
Pubblicazione: (2025)
Why do language models perform worse for morphologically complex languages?
di: Arnett, Catherine, et al.
Pubblicazione: (2024)
di: Arnett, Catherine, et al.
Pubblicazione: (2024)
One Thousand and One Pairs: A "novel" challenge for long-context language models
di: Karpinska, Marzena, et al.
Pubblicazione: (2024)
di: Karpinska, Marzena, et al.
Pubblicazione: (2024)
One ruler to measure them all: Benchmarking multilingual long-context language models
di: Kim, Yekyung, et al.
Pubblicazione: (2025)
di: Kim, Yekyung, et al.
Pubblicazione: (2025)
Recourse for reclamation: Chatting with generative language models
di: Chien, Jennifer, et al.
Pubblicazione: (2024)
di: Chien, Jennifer, et al.
Pubblicazione: (2024)
In-Context Learning Dynamics with Random Binary Sequences
di: Bigelow, Eric J., et al.
Pubblicazione: (2023)
di: Bigelow, Eric J., et al.
Pubblicazione: (2023)
Predicting challenge moments from students' discourse: A comparison of GPT-4 to two traditional natural language processing approaches
di: Suraworachet, Wannapon, et al.
Pubblicazione: (2024)
di: Suraworachet, Wannapon, et al.
Pubblicazione: (2024)
Evaluating the capability of large language models to personalize science texts for diverse middle-school-age learners
di: Vaccaro Jr, Michael, et al.
Pubblicazione: (2024)
di: Vaccaro Jr, Michael, et al.
Pubblicazione: (2024)
Revealing emergent human-like conceptual representations from language prediction
di: Xu, Ningyu, et al.
Pubblicazione: (2025)
di: Xu, Ningyu, et al.
Pubblicazione: (2025)
RigoChat 2: an adapted language model to Spanish using a bounded dataset and reduced hardware
di: Gómez, Gonzalo Santamaría, et al.
Pubblicazione: (2025)
di: Gómez, Gonzalo Santamaría, et al.
Pubblicazione: (2025)
Efficient semantic uncertainty quantification in language models via diversity-steered sampling
di: Park, Ji Won, et al.
Pubblicazione: (2025)
di: Park, Ji Won, et al.
Pubblicazione: (2025)
PathAlign: A vision-language model for whole slide images in histopathology
di: Ahmed, Faruk, et al.
Pubblicazione: (2024)
di: Ahmed, Faruk, et al.
Pubblicazione: (2024)
Large language models have learned to use language
di: Lupyan, Gary
Pubblicazione: (2025)
di: Lupyan, Gary
Pubblicazione: (2025)
Tiny language models
di: Gross, Ronit D., et al.
Pubblicazione: (2025)
di: Gross, Ronit D., et al.
Pubblicazione: (2025)
Belief Dynamics Reveal the Dual Nature of In-Context Learning and Activation Steering
di: Bigelow, Eric, et al.
Pubblicazione: (2025)
di: Bigelow, Eric, et al.
Pubblicazione: (2025)
Emergence of Hierarchical Emotion Organization in Large Language Models
di: Zhao, Bo, et al.
Pubblicazione: (2025)
di: Zhao, Bo, et al.
Pubblicazione: (2025)
Can we teach language models to gloss endangered languages?
di: Ginn, Michael, et al.
Pubblicazione: (2024)
di: Ginn, Michael, et al.
Pubblicazione: (2024)
The current status of large language models in summarizing radiology report impressions
di: Hu, Danqing, et al.
Pubblicazione: (2024)
di: Hu, Danqing, et al.
Pubblicazione: (2024)
Retrieval augmentation of large language models for lay language generation
di: Guo, Yue, et al.
Pubblicazione: (2022)
di: Guo, Yue, et al.
Pubblicazione: (2022)
Do large language models resemble humans in language use?
di: Cai, Zhenguang G., et al.
Pubblicazione: (2023)
di: Cai, Zhenguang G., et al.
Pubblicazione: (2023)
Studies with impossible languages falsify LMs as models of human language
di: Bowers, Jeffrey S., et al.
Pubblicazione: (2025)
di: Bowers, Jeffrey S., et al.
Pubblicazione: (2025)
Learning diverse attacks on large language models for robust red-teaming and safety tuning
di: Lee, Seanie, et al.
Pubblicazione: (2024)
di: Lee, Seanie, et al.
Pubblicazione: (2024)
A survey of diversity quantification in natural language processing: The why, what, where and how
di: Estève, Louis, et al.
Pubblicazione: (2025)
di: Estève, Louis, et al.
Pubblicazione: (2025)
Prompting language influences diagnostic reasoning and accuracy of large language models
di: Bazoge, Adrien, et al.
Pubblicazione: (2026)
di: Bazoge, Adrien, et al.
Pubblicazione: (2026)
Realtime, multimodal invasive ventilation risk monitoring using language models and BoXHED
di: Pakbin, Arash, et al.
Pubblicazione: (2024)
di: Pakbin, Arash, et al.
Pubblicazione: (2024)
Large language models are not about natural language
di: Bolhuis, Johan J., et al.
Pubblicazione: (2025)
di: Bolhuis, Johan J., et al.
Pubblicazione: (2025)
Dissociating language and thought in large language models
di: Mahowald, Kyle, et al.
Pubblicazione: (2023)
di: Mahowald, Kyle, et al.
Pubblicazione: (2023)
Amortizing intractable inference in large language models
di: Hu, Edward J., et al.
Pubblicazione: (2023)
di: Hu, Edward J., et al.
Pubblicazione: (2023)
Dynamic data sampler for cross-language transfer learning in large language models
di: Li, Yudong, et al.
Pubblicazione: (2024)
di: Li, Yudong, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Cognitive models can reveal interpretable value trade-offs in language models
di: Murthy, Sonia K., et al.
Pubblicazione: (2025) -
Re-evaluating Theory of Mind evaluation in large language models
di: Hu, Jennifer, et al.
Pubblicazione: (2025) -
Shades of Zero: Distinguishing Impossibility from Inconceivability
di: Hu, Jennifer, et al.
Pubblicazione: (2025) -
The Illusion-Illusion: Vision Language Models See Illusions Where There are None
di: Ullman, Tomer
Pubblicazione: (2024) -
Relations, Negations, and Numbers: Looking for Logic in Generative Text-to-Image Models
di: Conwell, Colin, et al.
Pubblicazione: (2024)