Understanding the Capabilities and Limitations of Large Language Models for Cultural Commonsense
Fuente:
arXiv
Guardado en:
| Autores principales: | Shen, Siqi, Logeswaran, Lajanugen, Lee, Moontae, Lee, Honglak, Poria, Soujanya, Mihalcea, Rada |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Revisiting LLM Value Probing Strategies: Are They Robust and Expressive?
por: Shen, Siqi, et al.
Publicado: (2025)
por: Shen, Siqi, et al.
Publicado: (2025)
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
por: Khalifa, Muhammad, et al.
Publicado: (2023)
por: Khalifa, Muhammad, et al.
Publicado: (2023)
Small Language Models Need Strong Verifiers to Self-Correct Reasoning
por: Zhang, Yunxiang, et al.
Publicado: (2024)
por: Zhang, Yunxiang, et al.
Publicado: (2024)
SPRIG: Improving Large Language Model Performance by System Prompt Optimization
por: Zhang, Lechen, et al.
Publicado: (2024)
por: Zhang, Lechen, et al.
Publicado: (2024)
When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models
por: Zheng, Mingqian, et al.
Publicado: (2023)
por: Zheng, Mingqian, et al.
Publicado: (2023)
Auto-Intent: Automated Intent Discovery and Self-Exploration for Large Language Model Web Agents
por: Kim, Jaekyeom, et al.
Publicado: (2024)
por: Kim, Jaekyeom, et al.
Publicado: (2024)
Process Reward Models That Think
por: Khalifa, Muhammad, et al.
Publicado: (2025)
por: Khalifa, Muhammad, et al.
Publicado: (2025)
Gaming the Judge: Unfaithful Chain-of-Thought Can Undermine Agent Evaluation
por: Khalifa, Muhammad, et al.
Publicado: (2026)
por: Khalifa, Muhammad, et al.
Publicado: (2026)
AutoGuide: Automated Generation and Selection of Context-Aware Guidelines for Large Language Model Agents
por: Fu, Yao, et al.
Publicado: (2024)
por: Fu, Yao, et al.
Publicado: (2024)
Cross-Lingual Prompt Steerability: Towards Accurate and Robust LLM Behavior across Languages
por: Zhang, Lechen, et al.
Publicado: (2025)
por: Zhang, Lechen, et al.
Publicado: (2025)
You don't need a personality test to know these models are unreliable: Assessing the Reliability of Large Language Models on Psychometric Instruments
por: Shu, Bangzhao, et al.
Publicado: (2023)
por: Shu, Bangzhao, et al.
Publicado: (2023)
Evaluating LLMs' Mathematical and Coding Competency through Ontology-guided Interventions
por: Hong, Pengfei, et al.
Publicado: (2024)
por: Hong, Pengfei, et al.
Publicado: (2024)
Visual Test-time Scaling for GUI Agent Grounding
por: Luo, Tiange, et al.
Publicado: (2025)
por: Luo, Tiange, et al.
Publicado: (2025)
Towards Robust Instruction Tuning on Multimodal Large Language Models
por: Han, Wei, et al.
Publicado: (2024)
por: Han, Wei, et al.
Publicado: (2024)
The Generation Gap: Exploring Age Bias in the Value Systems of Large Language Models
por: Liu, Siyang, et al.
Publicado: (2024)
por: Liu, Siyang, et al.
Publicado: (2024)
Selective LoRA for Visual Tokens and Attention Heads
por: Luo, Tiange, et al.
Publicado: (2025)
por: Luo, Tiange, et al.
Publicado: (2025)
The Age of Curiosity Meets the Age of AI: Benchmarking Child Safety in Large Language Models
por: Arif, Samee, et al.
Publicado: (2026)
por: Arif, Samee, et al.
Publicado: (2026)
Tango 2: Aligning Diffusion-based Text-to-Audio Generations through Direct Preference Optimization
por: Majumder, Navonil, et al.
Publicado: (2024)
por: Majumder, Navonil, et al.
Publicado: (2024)
Scalable Video-to-Dataset Generation for Cross-Platform Mobile Agents
por: Jang, Yunseok, et al.
Publicado: (2025)
por: Jang, Yunseok, et al.
Publicado: (2025)
The Curious Case of Curiosity across Human Cultures and LLMs
por: Borah, Angana, et al.
Publicado: (2025)
por: Borah, Angana, et al.
Publicado: (2025)
Language Models are Homer Simpson! Safety Re-Alignment of Fine-tuned Language Models through Task Arithmetic
por: Bhardwaj, Rishabh, et al.
Publicado: (2024)
por: Bhardwaj, Rishabh, et al.
Publicado: (2024)
Sowing the Wind, Reaping the Whirlwind: The Impact of Editing Language Models
por: Hazra, Rima, et al.
Publicado: (2024)
por: Hazra, Rima, et al.
Publicado: (2024)
Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning
por: Toh, Vernon Y. H., et al.
Publicado: (2024)
por: Toh, Vernon Y. H., et al.
Publicado: (2024)
Safety Arithmetic: A Framework for Test-time Safety Alignment of Language Models by Steering Parameters and Activations
por: Hazra, Rima, et al.
Publicado: (2024)
por: Hazra, Rima, et al.
Publicado: (2024)
Are Human Interactions Replicable by Generative Agents? A Case Study on Pronoun Usage in Hierarchical Interactions
por: Deng, Naihao, et al.
Publicado: (2025)
por: Deng, Naihao, et al.
Publicado: (2025)
Harnessing Large Language Models for Scientific Novelty Detection
por: Liu, Yan, et al.
Publicado: (2025)
por: Liu, Yan, et al.
Publicado: (2025)
Towards Implicit Bias Detection and Mitigation in Multi-Agent LLM Interactions
por: Borah, Angana, et al.
Publicado: (2024)
por: Borah, Angana, et al.
Publicado: (2024)
DELLA-Merging: Reducing Interference in Model Merging through Magnitude-Based Sampling
por: Deep, Pala Tej, et al.
Publicado: (2024)
por: Deep, Pala Tej, et al.
Publicado: (2024)
Persuasion at Play: Understanding Misinformation Dynamics in Demographic-Aware Human-LLM Interactions
por: Borah, Angana, et al.
Publicado: (2025)
por: Borah, Angana, et al.
Publicado: (2025)
The Power of Many: Multi-Agent Multimodal Models for Cultural Image Captioning
por: Bai, Longju, et al.
Publicado: (2024)
por: Bai, Longju, et al.
Publicado: (2024)
ViCor: Bridging Visual Understanding and Commonsense Reasoning with Large Language Models
por: Zhou, Kaiwen, et al.
Publicado: (2023)
por: Zhou, Kaiwen, et al.
Publicado: (2023)
Large Language Models for Automated Open-domain Scientific Hypotheses Discovery
por: Yang, Zonglin, et al.
Publicado: (2023)
por: Yang, Zonglin, et al.
Publicado: (2023)
Rethinking Table Instruction Tuning
por: Deng, Naihao, et al.
Publicado: (2025)
por: Deng, Naihao, et al.
Publicado: (2025)
Democratic or Authoritarian? Probing a New Dimension of Political Biases in Large Language Models
por: Piedrahita, David Guzman, et al.
Publicado: (2025)
por: Piedrahita, David Guzman, et al.
Publicado: (2025)
Scaling Web Agent Training through Automatic Data Generation and Fine-grained Evaluation
por: Logeswaran, Lajanugen, et al.
Publicado: (2026)
por: Logeswaran, Lajanugen, et al.
Publicado: (2026)
Towards Algorithmic Fidelity: Mental Health Representation across Demographics in Synthetic vs. Human-generated Data
por: Mori, Shinka, et al.
Publicado: (2024)
por: Mori, Shinka, et al.
Publicado: (2024)
MLRC-Bench: Can Language Agents Solve Machine Learning Research Challenges?
por: Zhang, Yunxiang, et al.
Publicado: (2025)
por: Zhang, Yunxiang, et al.
Publicado: (2025)
When Do Language Models Endorse Limitations on Human Rights Principles?
por: Samway, Keenan, et al.
Publicado: (2026)
por: Samway, Keenan, et al.
Publicado: (2026)
PREMISE: Matching-based Prediction for Accurate Review Recommendation
por: Han, Wei, et al.
Publicado: (2025)
por: Han, Wei, et al.
Publicado: (2025)
Can-Do! A Dataset and Neuro-Symbolic Grounded Framework for Embodied Planning with Large Multimodal Models
por: Chia, Yew Ken, et al.
Publicado: (2024)
por: Chia, Yew Ken, et al.
Publicado: (2024)
Ejemplares similares
-
Revisiting LLM Value Probing Strategies: Are They Robust and Expressive?
por: Shen, Siqi, et al.
Publicado: (2025) -
GRACE: Discriminator-Guided Chain-of-Thought Reasoning
por: Khalifa, Muhammad, et al.
Publicado: (2023) -
Small Language Models Need Strong Verifiers to Self-Correct Reasoning
por: Zhang, Yunxiang, et al.
Publicado: (2024) -
SPRIG: Improving Large Language Model Performance by System Prompt Optimization
por: Zhang, Lechen, et al.
Publicado: (2024) -
When "A Helpful Assistant" Is Not Really Helpful: Personas in System Prompts Do Not Improve Performances of Large Language Models
por: Zheng, Mingqian, et al.
Publicado: (2023)