OOP: Object-Oriented Programming Evaluation Benchmark for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Shuai, Ding, Liang, Shen, Li, Luo, Yong, Du, Bo, Tao, Dacheng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Revisiting Knowledge Distillation for Autoregressive Language Models
por: Zhong, Qihuang, et al.
Publicado: (2024)
por: Zhong, Qihuang, et al.
Publicado: (2024)
ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding
por: Zhong, Qihuang, et al.
Publicado: (2024)
por: Zhong, Qihuang, et al.
Publicado: (2024)
A Multi-Language Object-Oriented Programming Benchmark for Large Language Models
por: Wang, Shuai, et al.
Publicado: (2025)
por: Wang, Shuai, et al.
Publicado: (2025)
Revisiting Catastrophic Forgetting in Large Language Model Tuning
por: Li, Hongyu, et al.
Publicado: (2024)
por: Li, Hongyu, et al.
Publicado: (2024)
Better, Faster: Harnessing Self-Improvement in Large Reasoning Models
por: Zhong, Qihuang, et al.
Publicado: (2026)
por: Zhong, Qihuang, et al.
Publicado: (2026)
Retrieval-Augmented Perception: High-Resolution Image Perception Meets Visual RAG
por: Wang, Wenbin, et al.
Publicado: (2025)
por: Wang, Wenbin, et al.
Publicado: (2025)
E2S2: Encoding-Enhanced Sequence-to-Sequence Pretraining for Language Understanding and Generation
por: Zhong, Qihuang, et al.
Publicado: (2022)
por: Zhong, Qihuang, et al.
Publicado: (2022)
WisdoM: Improving Multimodal Sentiment Analysis by Fusing Contextual World Knowledge
por: Wang, Wenbin, et al.
Publicado: (2024)
por: Wang, Wenbin, et al.
Publicado: (2024)
Error Analysis Prompting Enables Human-Like Translation Evaluation in Large Language Models
por: Lu, Qingyu, et al.
Publicado: (2023)
por: Lu, Qingyu, et al.
Publicado: (2023)
PANDA: Prompt Transfer Meets Knowledge Distillation for Efficient Model Adaptation
por: Zhong, Qihuang, et al.
Publicado: (2022)
por: Zhong, Qihuang, et al.
Publicado: (2022)
FusionBench: A Unified Library and Comprehensive Benchmark for Deep Model Fusion
por: Tang, Anke, et al.
Publicado: (2024)
por: Tang, Anke, et al.
Publicado: (2024)
JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models
por: Chen, Michael K., et al.
Publicado: (2025)
por: Chen, Michael K., et al.
Publicado: (2025)
Learning from Imperfect Data: Towards Efficient Knowledge Distillation of Autoregressive Language Models for Text-to-SQL
por: Zhong, Qihuang, et al.
Publicado: (2024)
por: Zhong, Qihuang, et al.
Publicado: (2024)
CodeApex: A Bilingual Programming Evaluation Benchmark for Large Language Models
por: Fu, Lingyue, et al.
Publicado: (2023)
por: Fu, Lingyue, et al.
Publicado: (2023)
Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing
por: Wu, Yuchen, et al.
Publicado: (2025)
por: Wu, Yuchen, et al.
Publicado: (2025)
Robust Knowledge Editing via Explicit Reasoning Chains for Distractor-Resilient Multi-Hop QA
por: Wu, Yuchen, et al.
Publicado: (2025)
por: Wu, Yuchen, et al.
Publicado: (2025)
Towards Reliable Medical LLMs: Benchmarking and Enhancing Confidence Estimation of Large Language Models in Medical Consultation
por: Ren, Zhiyao, et al.
Publicado: (2026)
por: Ren, Zhiyao, et al.
Publicado: (2026)
Model Hemorrhage and the Robustness Limits of Large Language Models
por: Ma, Ziyang, et al.
Publicado: (2025)
por: Ma, Ziyang, et al.
Publicado: (2025)
A Survey on Knowledge Distillation of Large Language Models
por: Xu, Xiaohan, et al.
Publicado: (2024)
por: Xu, Xiaohan, et al.
Publicado: (2024)
Edit Once, Update Everywhere: A Simple Framework for Cross-Lingual Knowledge Synchronization in LLMs
por: Wu, Yuchen, et al.
Publicado: (2025)
por: Wu, Yuchen, et al.
Publicado: (2025)
Uncertainty Aware Learning for Language Model Alignment
por: Wang, Yikun, et al.
Publicado: (2024)
por: Wang, Yikun, et al.
Publicado: (2024)
Leveraging Large Language Models for NLG Evaluation: Advances and Challenges
por: Li, Zhen, et al.
Publicado: (2024)
por: Li, Zhen, et al.
Publicado: (2024)
Learn from Downstream and Be Yourself in Multimodal Large Language Model Fine-Tuning
por: Huang, Wenke, et al.
Publicado: (2024)
por: Huang, Wenke, et al.
Publicado: (2024)
Aligning Large Language Models from Self-Reference AI Feedback with one General Principle
por: Bao, Rong, et al.
Publicado: (2024)
por: Bao, Rong, et al.
Publicado: (2024)
Improving Complex Reasoning over Knowledge Graph with Logic-Aware Curriculum Tuning
por: Xia, Tianle, et al.
Publicado: (2024)
por: Xia, Tianle, et al.
Publicado: (2024)
Resolving Knowledge Conflicts in Domain-specific Data Selection: A Case Study on Medical Instruction-tuning
por: Zhong, Qihuang, et al.
Publicado: (2025)
por: Zhong, Qihuang, et al.
Publicado: (2025)
KaFT: Knowledge-aware Fine-tuning for Boosting LLMs' Domain-specific Question-Answering Performance
por: Zhong, Qihuang, et al.
Publicado: (2025)
por: Zhong, Qihuang, et al.
Publicado: (2025)
The Bitter Lesson of Diffusion Language Models for Agentic Workflows: A Comprehensive Reality Check
por: Lu, Qingyu, et al.
Publicado: (2026)
por: Lu, Qingyu, et al.
Publicado: (2026)
Diversifying the Mixture-of-Experts Representation for Language Models with Orthogonal Optimizer
por: Liu, Boan, et al.
Publicado: (2023)
por: Liu, Boan, et al.
Publicado: (2023)
Beyond Benchmarking: A New Paradigm for Evaluation and Assessment of Large Language Models
por: Liu, Jin, et al.
Publicado: (2024)
por: Liu, Jin, et al.
Publicado: (2024)
Entropy-Guided Watermarking for LLMs: A Test-Time Framework for Robust and Traceable Text Generation
por: Cai, Shizhan, et al.
Publicado: (2025)
por: Cai, Shizhan, et al.
Publicado: (2025)
CFinBench: A Comprehensive Chinese Financial Benchmark for Large Language Models
por: Nie, Ying, et al.
Publicado: (2024)
por: Nie, Ying, et al.
Publicado: (2024)
MLaKE: Multilingual Knowledge Editing Benchmark for Large Language Models
por: Wei, Zihao, et al.
Publicado: (2024)
por: Wei, Zihao, et al.
Publicado: (2024)
Building Accurate Translation-Tailored LLMs with Language Aware Instruction Tuning
por: Zan, Changtong, et al.
Publicado: (2024)
por: Zan, Changtong, et al.
Publicado: (2024)
LLMC: Benchmarking Large Language Model Quantization with a Versatile Compression Toolkit
por: Gong, Ruihao, et al.
Publicado: (2024)
por: Gong, Ruihao, et al.
Publicado: (2024)
Detoxifying Large Language Models via Autoregressive Reward Guided Representation Editing
por: Xiao, Yisong, et al.
Publicado: (2025)
por: Xiao, Yisong, et al.
Publicado: (2025)
Exploring and Enhancing the Transfer of Distribution in Knowledge Distillation for Autoregressive Language Models
por: Rao, Jun, et al.
Publicado: (2024)
por: Rao, Jun, et al.
Publicado: (2024)
RoleEval: A Bilingual Role Evaluation Benchmark for Large Language Models
por: Shen, Tianhao, et al.
Publicado: (2023)
por: Shen, Tianhao, et al.
Publicado: (2023)
Runaway is Ashamed, But Helpful: On the Early-Exit Behavior of Large Language Model-based Agents in Embodied Environments
por: Lu, Qingyu, et al.
Publicado: (2025)
por: Lu, Qingyu, et al.
Publicado: (2025)
MQM-APE: Toward High-Quality Error Annotation Predictors with Automatic Post-Editing in LLM Translation Evaluators
por: Lu, Qingyu, et al.
Publicado: (2024)
por: Lu, Qingyu, et al.
Publicado: (2024)
Ejemplares similares
-
Revisiting Knowledge Distillation for Autoregressive Language Models
por: Zhong, Qihuang, et al.
Publicado: (2024) -
ROSE Doesn't Do That: Boosting the Safety of Instruction-Tuned Large Language Models with Reverse Prompt Contrastive Decoding
por: Zhong, Qihuang, et al.
Publicado: (2024) -
A Multi-Language Object-Oriented Programming Benchmark for Large Language Models
por: Wang, Shuai, et al.
Publicado: (2025) -
Revisiting Catastrophic Forgetting in Large Language Model Tuning
por: Li, Hongyu, et al.
Publicado: (2024) -
Better, Faster: Harnessing Self-Improvement in Large Reasoning Models
por: Zhong, Qihuang, et al.
Publicado: (2026)