Benchmarking Concept-Spilling Across Languages in LLMs
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Badanin, Ilia, Dzenhaliou, Daniil, Schlag, Imanol |
|---|---|
| Format: | Preprint |
| Publié: |
2026
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
par: Limozin, Alexis, et autres
Publié: (2026)
par: Limozin, Alexis, et autres
Publié: (2026)
Spilled Energy in Large Language Models
par: Minut, Adrian Robert, et autres
Publié: (2026)
par: Minut, Adrian Robert, et autres
Publié: (2026)
Adapting Multilingual LLMs to Low-Resource Languages with Knowledge Graphs via Adapters
par: Gurgurov, Daniil, et autres
Publié: (2024)
par: Gurgurov, Daniil, et autres
Publié: (2024)
Persona-Augmented Benchmarking: Evaluating LLMs Across Diverse Writing Styles
par: Truong, Kimberly Le, et autres
Publié: (2025)
par: Truong, Kimberly Le, et autres
Publié: (2025)
LIBERTy: A Causal Framework for Benchmarking Concept-Based Explanations of LLMs with Structural Counterfactuals
par: Toker, Gilat, et autres
Publié: (2026)
par: Toker, Gilat, et autres
Publié: (2026)
Framing Political Bias in Multilingual LLMs Across Pakistani Languages
par: Nadeem, Afrozah, et autres
Publié: (2025)
par: Nadeem, Afrozah, et autres
Publié: (2025)
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
par: Wu, Yanan, et autres
Publié: (2024)
par: Wu, Yanan, et autres
Publié: (2024)
Learning the Topic, Not the Language: How LLMs Classify Online Immigration Discourse Across Languages
par: Nasuto, Andrea, et autres
Publié: (2025)
par: Nasuto, Andrea, et autres
Publié: (2025)
Concept Attractors in LLMs and their Applications
par: Chytas, Sotirios Panagiotis, et autres
Publié: (2025)
par: Chytas, Sotirios Panagiotis, et autres
Publié: (2025)
<think> So let's replace this phrase with insult... </think> Lessons learned from generation of toxic texts with LLMs
par: Pletenev, Sergey, et autres
Publié: (2025)
par: Pletenev, Sergey, et autres
Publié: (2025)
Traveling Across Languages: Benchmarking Cross-Lingual Consistency in Multimodal LLMs
par: Wang, Hao, et autres
Publié: (2025)
par: Wang, Hao, et autres
Publié: (2025)
Beyond Specialization: Benchmarking LLMs for Transliteration of Indian Languages
par: Azam, Gulfarogh, et autres
Publié: (2025)
par: Azam, Gulfarogh, et autres
Publié: (2025)
Benchmarking LLMs for Mimicking Child-Caregiver Language in Interaction
par: Liu, Jing, et autres
Publié: (2024)
par: Liu, Jing, et autres
Publié: (2024)
NATURAL PLAN: Benchmarking LLMs on Natural Language Planning
par: Zheng, Huaixiu Steven, et autres
Publié: (2024)
par: Zheng, Huaixiu Steven, et autres
Publié: (2024)
POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents
par: Zheng, Qiaoyuan, et autres
Publié: (2026)
par: Zheng, Qiaoyuan, et autres
Publié: (2026)
Time Awareness in Large Language Models: Benchmarking Fact Recall Across Time
par: Herel, David, et autres
Publié: (2024)
par: Herel, David, et autres
Publié: (2024)
Cards Against LLMs: Benchmarking Humor Alignment in Large Language Models
par: Fettach, Yousra, et autres
Publié: (2026)
par: Fettach, Yousra, et autres
Publié: (2026)
General365: Benchmarking General Reasoning in Large Language Models Across Diverse and Challenging Tasks
par: Liu, Junlin, et autres
Publié: (2026)
par: Liu, Junlin, et autres
Publié: (2026)
Apertus: Democratizing Open and Compliant LLMs for Global Language Environments
par: Apertus, Project, et autres
Publié: (2025)
par: Apertus, Project, et autres
Publié: (2025)
Systematic Evaluation of Long-Context LLMs on Financial Concepts
par: Gupta, Lavanya, et autres
Publié: (2024)
par: Gupta, Lavanya, et autres
Publié: (2024)
Narrative Landscape: Mapping Narrative Dispositions Across LLMs
par: Jung, Donghoon, et autres
Publié: (2026)
par: Jung, Donghoon, et autres
Publié: (2026)
Benchmarking GPT-4 against Human Translators: A Comprehensive Evaluation Across Languages, Domains, and Expertise Levels
par: Yan, Jianhao, et autres
Publié: (2024)
par: Yan, Jianhao, et autres
Publié: (2024)
Let's Play Across Cultures: A Large Multilingual, Multicultural Benchmark for Assessing Language Models' Understanding of Sports
par: Singh, Punit Kumar, et autres
Publié: (2025)
par: Singh, Punit Kumar, et autres
Publié: (2025)
Domain Knowledge-Enhanced LLMs for Fraud and Concept Drift Detection
par: Şenol, Ali, et autres
Publié: (2025)
par: Şenol, Ali, et autres
Publié: (2025)
LLM-BABYBENCH: Understanding and Evaluating Grounded Planning and Reasoning in LLMs
par: Choukrani, Omar, et autres
Publié: (2025)
par: Choukrani, Omar, et autres
Publié: (2025)
League of LLMs: A Benchmark-Free Paradigm for Mutual Evaluation of Large Language Models
par: Guo, Qianhong, et autres
Publié: (2025)
par: Guo, Qianhong, et autres
Publié: (2025)
ConceptPsy:A Benchmark Suite with Conceptual Comprehensiveness in Psychology
par: Zhang, Junlei, et autres
Publié: (2023)
par: Zhang, Junlei, et autres
Publié: (2023)
Do Language Models Reason Across Languages?
par: Meng, Yan, et autres
Publié: (2026)
par: Meng, Yan, et autres
Publié: (2026)
Explanation Fairness in Large Language Models: An Empirical Analysis of Disparities in How LLMs Justify Decisions Across Demographic Groups
par: Veldanda, Gautam
Publié: (2026)
par: Veldanda, Gautam
Publié: (2026)
LLMs-in-the-Loop Part 2: Expert Small AI Models for Anonymization and De-identification of PHI Across Multiple Languages
par: Gunay, Murat, et autres
Publié: (2024)
par: Gunay, Murat, et autres
Publié: (2024)
Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish
par: Xia, Chengxuan, et autres
Publié: (2025)
par: Xia, Chengxuan, et autres
Publié: (2025)
What is a Number, That a Large Language Model May Know It?
par: Marjieh, Raja, et autres
Publié: (2025)
par: Marjieh, Raja, et autres
Publié: (2025)
When Speculation Spills Secrets: Side Channels via Speculative Decoding In LLMs
par: Wei, Jiankun, et autres
Publié: (2024)
par: Wei, Jiankun, et autres
Publié: (2024)
CresOWLve: Benchmarking Creative Problem-Solving Over Real-World Knowledge
par: Ismayilzada, Mete, et autres
Publié: (2026)
par: Ismayilzada, Mete, et autres
Publié: (2026)
Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space
par: Zhang, Zhen, et autres
Publié: (2025)
par: Zhang, Zhen, et autres
Publié: (2025)
Facilitating large language model Russian adaptation with Learned Embedding Propagation
par: Tikhomirov, Mikhail, et autres
Publié: (2024)
par: Tikhomirov, Mikhail, et autres
Publié: (2024)
Predict the Next Word: Humans exhibit uncertainty in this task and language models _____
par: Ilia, Evgenia, et autres
Publié: (2024)
par: Ilia, Evgenia, et autres
Publié: (2024)
Can LLMs Correct Themselves? A Benchmark of Self-Correction in LLMs
par: Tie, Guiyao, et autres
Publié: (2025)
par: Tie, Guiyao, et autres
Publié: (2025)
Navigating the Concept Space of Language Models
par: Marcílio-Jr, Wilson E., et autres
Publié: (2026)
par: Marcílio-Jr, Wilson E., et autres
Publié: (2026)
Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark
par: Xu, Shuhang, et autres
Publié: (2025)
par: Xu, Shuhang, et autres
Publié: (2025)
Documents similaires
-
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
par: Limozin, Alexis, et autres
Publié: (2026) -
Spilled Energy in Large Language Models
par: Minut, Adrian Robert, et autres
Publié: (2026) -
Adapting Multilingual LLMs to Low-Resource Languages with Knowledge Graphs via Adapters
par: Gurgurov, Daniil, et autres
Publié: (2024) -
Persona-Augmented Benchmarking: Evaluating LLMs Across Diverse Writing Styles
par: Truong, Kimberly Le, et autres
Publié: (2025) -
LIBERTy: A Causal Framework for Benchmarking Concept-Based Explanations of LLMs with Structural Counterfactuals
par: Toker, Gilat, et autres
Publié: (2026)