CS-Bench: A Comprehensive Benchmark for Large Language Models towards Computer Science Mastery
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Song, Xiaoshuai, Diao, Muxi, Dong, Guanting, Wang, Zhengyang, Fu, Yujia, Qiao, Runqi, Wang, Zhexu, Fu, Dayuan, Wu, Huangxuan, Liang, Bin, Zeng, Weihao, Wang, Yejie, GongQue, Zhuoma, Yu, Jianing, Tan, Qiuna, Xu, Weiran |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
par: Wang, Yejie, et autres
Publié: (2024)
par: Wang, Yejie, et autres
Publié: (2024)
Multi-Perspective Consistency Enhances Confidence Estimation in Large Language Models
par: Wang, Pei, et autres
Publié: (2024)
par: Wang, Pei, et autres
Publié: (2024)
BootTOD: Bootstrap Task-oriented Dialogue Representations by Aligning Diverse Responses
par: Zeng, Weihao, et autres
Publié: (2024)
par: Zeng, Weihao, et autres
Publié: (2024)
Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models
par: Zhang, YiFan, et autres
Publié: (2024)
par: Zhang, YiFan, et autres
Publié: (2024)
We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?
par: Qiao, Runqi, et autres
Publié: (2024)
par: Qiao, Runqi, et autres
Publié: (2024)
DivTOD: Unleashing the Power of LLMs for Diversifying Task-Oriented Dialogue Representations
par: Zeng, Weihao, et autres
Publié: (2024)
par: Zeng, Weihao, et autres
Publié: (2024)
AgentRefine: Enhancing Agent Generalization through Refinement Tuning
par: Fu, Dayuan, et autres
Publié: (2025)
par: Fu, Dayuan, et autres
Publié: (2025)
PreAct: Prediction Enhances Agent's Planning Ability
par: Fu, Dayuan, et autres
Publié: (2024)
par: Fu, Dayuan, et autres
Publié: (2024)
DolphCoder: Echo-Locating Code Large Language Models with Diverse and Multi-Objective Instruction Tuning
par: Wang, Yejie, et autres
Publié: (2024)
par: Wang, Yejie, et autres
Publié: (2024)
DriveRX: A Vision-Language Reasoning Model for Cross-Task Autonomous Driving
par: Diao, Muxi, et autres
Publié: (2025)
par: Diao, Muxi, et autres
Publié: (2025)
OJBench: A Competition Level Code Benchmark For Large Language Models
par: Wang, Zhexu, et autres
Publié: (2025)
par: Wang, Zhexu, et autres
Publié: (2025)
Knowledge Editing on Black-box Large Language Models
par: Song, Xiaoshuai, et autres
Publié: (2024)
par: Song, Xiaoshuai, et autres
Publié: (2024)
Toward General Instruction-Following Alignment for Retrieval-Augmented Generation
par: Dong, Guanting, et autres
Publié: (2024)
par: Dong, Guanting, et autres
Publié: (2024)
InstructERC: Reforming Emotion Recognition in Conversation with Multi-task Retrieval-Augmented Large Language Models
par: Lei, Shanglin, et autres
Publié: (2023)
par: Lei, Shanglin, et autres
Publié: (2023)
Beyond the Known: Investigating LLMs Performance on Out-of-Domain Intent Detection
par: Wang, Pei, et autres
Publié: (2024)
par: Wang, Pei, et autres
Publié: (2024)
MSI-Agent: Incorporating Multi-Scale Insight into Embodied Agents for Superior Planning and Decision-Making
par: Fu, Dayuan, et autres
Publié: (2024)
par: Fu, Dayuan, et autres
Publié: (2024)
SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models
par: Diao, Muxi, et autres
Publié: (2024)
par: Diao, Muxi, et autres
Publié: (2024)
We-Math 2.0: A Versatile MathBook System for Incentivizing Visual Mathematical Reasoning
par: Qiao, Runqi, et autres
Publié: (2025)
par: Qiao, Runqi, et autres
Publié: (2025)
RO-Bench: Large-scale robustness evaluation of MLLMs with text-driven counterfactual videos
par: Yang, Zixi, et autres
Publié: (2025)
par: Yang, Zixi, et autres
Publié: (2025)
V-Thinker: Interactive Thinking with Images
par: Qiao, Runqi, et autres
Publié: (2025)
par: Qiao, Runqi, et autres
Publié: (2025)
Noise-BERT: A Unified Perturbation-Robust Framework with Noise Alignment Pre-training for Noisy Slot Filling Task
par: Zhao, Jinxu, et autres
Publié: (2024)
par: Zhao, Jinxu, et autres
Publié: (2024)
CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation
par: Wang, Xinran, et autres
Publié: (2025)
par: Wang, Xinran, et autres
Publié: (2025)
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
par: Zhang, Alexander, et autres
Publié: (2025)
par: Zhang, Alexander, et autres
Publié: (2025)
DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions
par: Wang, Xinran, et autres
Publié: (2026)
par: Wang, Xinran, et autres
Publié: (2026)
Face-Human-Bench: A Comprehensive Benchmark of Face and Human Understanding for Multi-modal Assistants
par: Qin, Lixiong, et autres
Publié: (2025)
par: Qin, Lixiong, et autres
Publié: (2025)
From Simple to Professional: A Combinatorial Controllable Image Captioning Agent
par: Wang, Xinran, et autres
Publié: (2024)
par: Wang, Xinran, et autres
Publié: (2024)
CS3-Bench: Evaluating and Enhancing Speech-to-Speech LLMs for Mandarin-English Code-Switching
par: Liu, Heyang, et autres
Publié: (2025)
par: Liu, Heyang, et autres
Publié: (2025)
Stable Consistency Tuning: Understanding and Improving Consistency Models
par: Wang, Fu-Yun, et autres
Publié: (2024)
par: Wang, Fu-Yun, et autres
Publié: (2024)
Harnessing Caption Detailness for Data-Efficient Text-to-Image Generation
par: Wang, Xinran, et autres
Publié: (2025)
par: Wang, Xinran, et autres
Publié: (2025)
Entropy-Adaptive Fine-Tuning: Resolving Confident Conflicts to Mitigate Forgetting
par: Diao, Muxi, et autres
Publié: (2026)
par: Diao, Muxi, et autres
Publié: (2026)
Parameter-Efficient Semantic Augmentation for Enhancing Open-Vocabulary Object Detection
par: Cao, Weihao, et autres
Publié: (2026)
par: Cao, Weihao, et autres
Publié: (2026)
Joint Unitarity and a Single Definite Outcome in a Quantum Measurement
par: Liu, Muxi
Publié: (2026)
par: Liu, Muxi
Publié: (2026)
Scientific Research on Terracotta Tiles From the Chengcun City Site of Han Dynasty, Wuyishan
par: Qiuna Shi, et autres
Publié: (2026)
par: Qiuna Shi, et autres
Publié: (2026)
Asexual Morph and Molecular Phylogeny of Erysiphe sambuci on Sambucus Hosts in China
par: Qucuo Zhuoma, et autres
Publié: (2025)
par: Qucuo Zhuoma, et autres
Publié: (2025)
Miner:Mining Intrinsic Mastery for Data-Efficient RL in Large Reasoning Models
par: Jiang, Shuyang, et autres
Publié: (2026)
par: Jiang, Shuyang, et autres
Publié: (2026)
Evaluating LLMs Across Multi-Cognitive Levels: From Medical Knowledge Mastery to Scenario-Based Problem Solving
par: Zhou, Yuxuan, et autres
Publié: (2025)
par: Zhou, Yuxuan, et autres
Publié: (2025)
Fusion to Enhance: Fusion Visual Encoder to Enhance Multimodal Language Model
par: She, Yifei, et autres
Publié: (2025)
par: She, Yifei, et autres
Publié: (2025)
Unthinking Mastery
par: Singh, Juliette
Publié: (2018)
par: Singh, Juliette
Publié: (2018)
GaraMoSt: Parallel Multi-Granularity Motion and Structural Modeling for Efficient Multi-Frame Interpolation in DSA Images
par: Xu, Ziyang, et autres
Publié: (2024)
par: Xu, Ziyang, et autres
Publié: (2024)
Construction of 3D Patterns Through Modified Electrochemical Replication and Transfer
par: Zijian Chen, et autres
Publié: (2024)
par: Zijian Chen, et autres
Publié: (2024)
Documents similaires
-
How Do Your Code LLMs Perform? Empowering Code Instruction Tuning with High-Quality Data
par: Wang, Yejie, et autres
Publié: (2024) -
Multi-Perspective Consistency Enhances Confidence Estimation in Large Language Models
par: Wang, Pei, et autres
Publié: (2024) -
BootTOD: Bootstrap Task-oriented Dialogue Representations by Aligning Diverse Responses
par: Zeng, Weihao, et autres
Publié: (2024) -
Multi-Dimensional Insights: Benchmarking Real-World Personalization in Large Multimodal Models
par: Zhang, YiFan, et autres
Publié: (2024) -
We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?
par: Qiao, Runqi, et autres
Publié: (2024)