CodeMixBench: Evaluating Code-Mixing Capabilities of LLMs Across 18 Languages
Fuente:
arXiv
Guardado en:
| Autores principales: | Yang, Yilun, Chai, Yekun |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
CodeMixBench: Evaluating Large Language Models on Code Generation with Code-Mixed Prompts
por: Sheokand, Manik, et al.
Publicado: (2025)
por: Sheokand, Manik, et al.
Publicado: (2025)
HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization
por: Peng, Qiwei, et al.
Publicado: (2024)
por: Peng, Qiwei, et al.
Publicado: (2024)
ChiEngMixBench: Evaluating Large Language Models on Spontaneous and Natural Chinese-English Code-Mixed Generation
por: Yang, Qingyan, et al.
Publicado: (2026)
por: Yang, Qingyan, et al.
Publicado: (2026)
Code-Mixer Ya Nahi: Novel Approaches to Measuring Multilingual LLMs' Code-Mixing Capabilities
por: Gupta, Ayushman, et al.
Publicado: (2024)
por: Gupta, Ayushman, et al.
Publicado: (2024)
Code Mixologist : A Practitioner's Guide to Building Code-Mixed LLMs
por: Gupta, Himanshu, et al.
Publicado: (2026)
por: Gupta, Himanshu, et al.
Publicado: (2026)
CodeEditorBench: Evaluating Code Editing Capability of Large Language Models
por: Guo, Jiawei, et al.
Publicado: (2024)
por: Guo, Jiawei, et al.
Publicado: (2024)
LongCodeBench: Evaluating Coding LLMs at 1M Context Windows
por: Rando, Stefano, et al.
Publicado: (2025)
por: Rando, Stefano, et al.
Publicado: (2025)
Lost in the Mix: Evaluating LLM Understanding of Code-Switched Text
por: Mohamed, Amr, et al.
Publicado: (2025)
por: Mohamed, Amr, et al.
Publicado: (2025)
MolViBench: Evaluating LLMs on Molecular Vibe Coding
por: Li, Jiatong, et al.
Publicado: (2026)
por: Li, Jiatong, et al.
Publicado: (2026)
DIVERS-Bench: Evaluating Language Identification Across Domain Shifts and Code-Switching
por: Ojo, Jessica, et al.
Publicado: (2025)
por: Ojo, Jessica, et al.
Publicado: (2025)
EvolKV: Evolutionary KV Cache Compression for LLM Inference
por: Yu, Bohan, et al.
Publicado: (2025)
por: Yu, Bohan, et al.
Publicado: (2025)
Multi-task Code LLMs: Data Mix or Model Merge?
por: Zhu, Mingzhi, et al.
Publicado: (2026)
por: Zhu, Mingzhi, et al.
Publicado: (2026)
Sentiment Analysis of Code-Mixed Languages leveraging Resource Rich Languages
por: Choudhary, Nurendra, et al.
Publicado: (2018)
por: Choudhary, Nurendra, et al.
Publicado: (2018)
Understanding Subword Compositionality of Large Language Models
por: Peng, Qiwei, et al.
Publicado: (2025)
por: Peng, Qiwei, et al.
Publicado: (2025)
Code-Vision: Evaluating Multimodal LLMs Logic Understanding and Code Generation Capabilities
por: Wang, Hanbin, et al.
Publicado: (2025)
por: Wang, Hanbin, et al.
Publicado: (2025)
PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization
por: Jing, Huihao, et al.
Publicado: (2026)
por: Jing, Huihao, et al.
Publicado: (2026)
Tokenization Falling Short: On Subword Robustness in Large Language Models
por: Chai, Yekun, et al.
Publicado: (2024)
por: Chai, Yekun, et al.
Publicado: (2024)
Debiasing Multilingual LLMs in Cross-lingual Latent Space
por: Peng, Qiwei, et al.
Publicado: (2025)
por: Peng, Qiwei, et al.
Publicado: (2025)
Rethinking Multilingual Continual Pretraining: Data Mixing for Adapting LLMs Across Languages and Resources
por: Li, Zihao, et al.
Publicado: (2025)
por: Li, Zihao, et al.
Publicado: (2025)
Evaluating the Generalization Capabilities of Large Language Models on Code Reasoning
por: Yang, Rem, et al.
Publicado: (2025)
por: Yang, Rem, et al.
Publicado: (2025)
MixSarc: A Bangla-English Code-Mixed Corpus for Implicit Meaning Identification
por: Alam, Kazi Samin Yasar, et al.
Publicado: (2026)
por: Alam, Kazi Samin Yasar, et al.
Publicado: (2026)
Leveraging Large Language Models for Code-Mixed Data Augmentation in Sentiment Analysis
por: Zeng, Linda
Publicado: (2024)
por: Zeng, Linda
Publicado: (2024)
Mixed-Distil-BERT: Code-mixed Language Modeling for Bangla, English, and Hindi
por: Raihan, Md Nishat, et al.
Publicado: (2023)
por: Raihan, Md Nishat, et al.
Publicado: (2023)
Code-Mixed Telugu-English Hate Speech Detection
por: Kakarla, Santhosh, et al.
Publicado: (2025)
por: Kakarla, Santhosh, et al.
Publicado: (2025)
BnSentMix: A Diverse Bengali-English Code-Mixed Dataset for Sentiment Analysis
por: Alam, Sadia, et al.
Publicado: (2024)
por: Alam, Sadia, et al.
Publicado: (2024)
Evaluating and Aligning CodeLLMs on Human Preference
por: Yang, Jian, et al.
Publicado: (2024)
por: Yang, Jian, et al.
Publicado: (2024)
IndicGenBench: A Multilingual Benchmark to Evaluate Generation Capabilities of LLMs on Indic Languages
por: Singh, Harman, et al.
Publicado: (2024)
por: Singh, Harman, et al.
Publicado: (2024)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
por: Zhang, Alexander, et al.
Publicado: (2025)
por: Zhang, Alexander, et al.
Publicado: (2025)
CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
por: Liu, Heyang, et al.
Publicado: (2025)
por: Liu, Heyang, et al.
Publicado: (2025)
LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code
por: Jain, Naman, et al.
Publicado: (2024)
por: Jain, Naman, et al.
Publicado: (2024)
Evaluating Cross-lingual Knowledge Consistency in Code-Mixed vis-a-vis Indian Languages using IndicKLAR
por: Mazumder, Debajyoti, et al.
Publicado: (2026)
por: Mazumder, Debajyoti, et al.
Publicado: (2026)
Code-Mixed Probes Show How Pre-Trained Models Generalise On Code-Switched Text
por: De Leon, Frances A. Laureano, et al.
Publicado: (2024)
por: De Leon, Frances A. Laureano, et al.
Publicado: (2024)
Evaluation of Code LLMs on Geospatial Code Generation
por: Gramacki, Piotr, et al.
Publicado: (2024)
por: Gramacki, Piotr, et al.
Publicado: (2024)
Multilingual Controlled Generation And Gold-Standard-Agnostic Evaluation of Code-Mixed Sentences
por: Gupta, Ayushman, et al.
Publicado: (2024)
por: Gupta, Ayushman, et al.
Publicado: (2024)
R1-Code-Interpreter: LLMs Reason with Code via Supervised and Multi-stage Reinforcement Learning
por: Chen, Yongchao, et al.
Publicado: (2025)
por: Chen, Yongchao, et al.
Publicado: (2025)
EmoMix-3L: A Code-Mixed Dataset for Bangla-English-Hindi Emotion Detection
por: Raihan, Nishat, et al.
Publicado: (2024)
por: Raihan, Nishat, et al.
Publicado: (2024)
ResearchCodeBench: Benchmarking LLMs on Implementing Novel Machine Learning Research Code
por: Hua, Tianyu, et al.
Publicado: (2025)
por: Hua, Tianyu, et al.
Publicado: (2025)
CodeSteer: Symbolic-Augmented Language Models via Code/Text Guidance
por: Chen, Yongchao, et al.
Publicado: (2025)
por: Chen, Yongchao, et al.
Publicado: (2025)
ExecRepoBench: Multi-level Executable Code Completion Evaluation
por: Yang, Jian, et al.
Publicado: (2024)
por: Yang, Jian, et al.
Publicado: (2024)
CodeIF-Bench: Evaluating Instruction-Following Capabilities of Large Language Models in Interactive Code Generation
por: Wang, Peiding, et al.
Publicado: (2025)
por: Wang, Peiding, et al.
Publicado: (2025)
Ejemplares similares
-
CodeMixBench: Evaluating Large Language Models on Code Generation with Code-Mixed Prompts
por: Sheokand, Manik, et al.
Publicado: (2025) -
HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization
por: Peng, Qiwei, et al.
Publicado: (2024) -
ChiEngMixBench: Evaluating Large Language Models on Spontaneous and Natural Chinese-English Code-Mixed Generation
por: Yang, Qingyan, et al.
Publicado: (2026) -
Code-Mixer Ya Nahi: Novel Approaches to Measuring Multilingual LLMs' Code-Mixing Capabilities
por: Gupta, Ayushman, et al.
Publicado: (2024) -
Code Mixologist : A Practitioner's Guide to Building Code-Mixed LLMs
por: Gupta, Himanshu, et al.
Publicado: (2026)