RoCar: A Relationship Network-based Evaluation Method for Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Ming, Wu, Wenfang, Gao, Chongyun, Wang, Daling, Feng, Shi, Zhang, Yifei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
por: Zhao, Yinzhi, et al.
Publicado: (2026)
por: Zhao, Yinzhi, et al.
Publicado: (2026)
T-COL: Generating Counterfactual Explanations for General User Preferences on Variable Machine Learning Systems
por: Wang, Ming, et al.
Publicado: (2023)
por: Wang, Ming, et al.
Publicado: (2023)
Language Models as Continuous Self-Evolving Data Engineers
por: Wang, Peidong, et al.
Publicado: (2024)
por: Wang, Peidong, et al.
Publicado: (2024)
Hierarchical Retrieval-Augmented Generation Model with Rethink for Multi-hop Question Answering
por: Zhang, Xiaoming, et al.
Publicado: (2024)
por: Zhang, Xiaoming, et al.
Publicado: (2024)
AnnaAgent: Dynamic Evolution Agent System with Multi-Session Memory for Realistic Seeker Simulation
por: Wang, Ming, et al.
Publicado: (2025)
por: Wang, Ming, et al.
Publicado: (2025)
Resource-Limited Joint Multimodal Sentiment Reasoning and Classification via Chain-of-Thought Enhancement and Distillation
por: Shangguan, Haonan, et al.
Publicado: (2025)
por: Shangguan, Haonan, et al.
Publicado: (2025)
RoTBench: A Multi-Level Benchmark for Evaluating the Robustness of Large Language Models in Tool Learning
por: Ye, Junjie, et al.
Publicado: (2024)
por: Ye, Junjie, et al.
Publicado: (2024)
CIRAG: Construction-Integration Retrieval and Adaptive Generation for Multi-hop Question Answering
por: Wei, Zili, et al.
Publicado: (2026)
por: Wei, Zili, et al.
Publicado: (2026)
RoSA: Enhancing Parameter-Efficient Fine-Tuning via RoPE-aware Selective Adaptation in Large Language Models
por: Pan, Dayan, et al.
Publicado: (2025)
por: Pan, Dayan, et al.
Publicado: (2025)
Survey on Knowledge Distillation for Large Language Models: Methods, Evaluation, and Application
por: Yang, Chuanpeng, et al.
Publicado: (2024)
por: Yang, Chuanpeng, et al.
Publicado: (2024)
Resonance RoPE: Improving Context Length Generalization of Large Language Models
por: Wang, Suyuchen, et al.
Publicado: (2024)
por: Wang, Suyuchen, et al.
Publicado: (2024)
NAACL2025 Tutorial: Adaptation of Large Language Models
por: Ke, Zixuan, et al.
Publicado: (2025)
por: Ke, Zixuan, et al.
Publicado: (2025)
STICKERCONV: Generating Multimodal Empathetic Responses from Scratch
por: Zhang, Yiqun, et al.
Publicado: (2024)
por: Zhang, Yiqun, et al.
Publicado: (2024)
GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective Testing
por: Wang, Ming, et al.
Publicado: (2026)
por: Wang, Ming, et al.
Publicado: (2026)
Generative Emotion Cause Explanation in Multimodal Conversations
por: Wang, Lin, et al.
Publicado: (2024)
por: Wang, Lin, et al.
Publicado: (2024)
Evaluating Quantized Large Language Models
por: Li, Shiyao, et al.
Publicado: (2024)
por: Li, Shiyao, et al.
Publicado: (2024)
LangGPT: Rethinking Structured Reusable Prompt Design Framework for LLMs from the Programming Language
por: Wang, Ming, et al.
Publicado: (2024)
por: Wang, Ming, et al.
Publicado: (2024)
CoSafe: Evaluating Large Language Model Safety in Multi-Turn Dialogue Coreference
por: Yu, Erxin, et al.
Publicado: (2024)
por: Yu, Erxin, et al.
Publicado: (2024)
SignMouth: Leveraging Mouthing Cues for Sign Language Translation by Multimodal Contrastive Fusion
por: Wu, Wenfang, et al.
Publicado: (2025)
por: Wu, Wenfang, et al.
Publicado: (2025)
MTRouter: Cost-Aware Multi-Turn LLM Routing with History-Model Joint Embeddings
por: Zhang, Yiqun, et al.
Publicado: (2026)
por: Zhang, Yiqun, et al.
Publicado: (2026)
A Survey on Evaluation of Large Language Models
por: Chang, Yupeng, et al.
Publicado: (2023)
por: Chang, Yupeng, et al.
Publicado: (2023)
EmoLLM: Appraisal-Grounded Cognitive-Emotional Co-Reasoning in Large Language Models
por: Zhang, Yifei, et al.
Publicado: (2026)
por: Zhang, Yifei, et al.
Publicado: (2026)
H2HTalk: Evaluating Large Language Models as Emotional Companion
por: Wang, Boyang, et al.
Publicado: (2025)
por: Wang, Boyang, et al.
Publicado: (2025)
Towards Localized and Disentangled Knowledge Editing for Multimodal Large Language Models
por: Gu, Leijiang, et al.
Publicado: (2026)
por: Gu, Leijiang, et al.
Publicado: (2026)
TCMBench: A Comprehensive Benchmark for Evaluating Large Language Models in Traditional Chinese Medicine
por: Yue, Wenjing, et al.
Publicado: (2024)
por: Yue, Wenjing, et al.
Publicado: (2024)
Evaluating Uncertainty Quantification Methods in Argumentative Large Language Models
por: Zhou, Kevin, et al.
Publicado: (2025)
por: Zhou, Kevin, et al.
Publicado: (2025)
Rethinking Toxicity Evaluation in Large Language Models: A Multi-Label Perspective
por: Kou, Zhiqiang, et al.
Publicado: (2025)
por: Kou, Zhiqiang, et al.
Publicado: (2025)
Evaluating the Factuality of Large Language Models using Large-Scale Knowledge Graphs
por: Liu, Xiaoze, et al.
Publicado: (2024)
por: Liu, Xiaoze, et al.
Publicado: (2024)
End-to-End Graph Flattening Method for Large Language Models
por: Hong, Bin, et al.
Publicado: (2024)
por: Hong, Bin, et al.
Publicado: (2024)
EssayBench: Evaluating Large Language Models in Multi-Genre Chinese Essay Writing
por: Gao, Fan, et al.
Publicado: (2025)
por: Gao, Fan, et al.
Publicado: (2025)
An In-depth Evaluation of Large Language Models in Sentence Simplification with Error-based Human Assessment
por: Wu, Xuanxin, et al.
Publicado: (2024)
por: Wu, Xuanxin, et al.
Publicado: (2024)
TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models
por: Li, Ce, et al.
Publicado: (2025)
por: Li, Ce, et al.
Publicado: (2025)
ReviewInstruct: A Review-Driven Multi-Turn Conversations Generation Method for Large Language Models
por: Wu, Jiangxu, et al.
Publicado: (2025)
por: Wu, Jiangxu, et al.
Publicado: (2025)
PROXYQA: An Alternative Framework for Evaluating Long-Form Text Generation with Large Language Models
por: Tan, Haochen, et al.
Publicado: (2024)
por: Tan, Haochen, et al.
Publicado: (2024)
CodeVisionary: An Agent-based Framework for Evaluating Large Language Models in Code Generation
por: Wang, Xinchen, et al.
Publicado: (2025)
por: Wang, Xinchen, et al.
Publicado: (2025)
TimeBench: A Comprehensive Evaluation of Temporal Reasoning Abilities in Large Language Models
por: Chu, Zheng, et al.
Publicado: (2023)
por: Chu, Zheng, et al.
Publicado: (2023)
Identifying the Achilles' Heel: An Iterative Method for Dynamically Uncovering Factual Errors in Large Language Models
por: Wang, Wenxuan, et al.
Publicado: (2024)
por: Wang, Wenxuan, et al.
Publicado: (2024)
FreeEval: A Modular Framework for Trustworthy and Efficient Evaluation of Large Language Models
por: Yu, Zhuohao, et al.
Publicado: (2024)
por: Yu, Zhuohao, et al.
Publicado: (2024)
ERBench: An Entity-Relationship based Automatically Verifiable Hallucination Benchmark for Large Language Models
por: Oh, Jio, et al.
Publicado: (2024)
por: Oh, Jio, et al.
Publicado: (2024)
LaCo: Large Language Model Pruning via Layer Collapse
por: Yang, Yifei, et al.
Publicado: (2024)
por: Yang, Yifei, et al.
Publicado: (2024)
Ejemplares similares
-
Defending Large Language Models Against Jailbreak Attacks via In-Decoding Safety-Awareness Probing
por: Zhao, Yinzhi, et al.
Publicado: (2026) -
T-COL: Generating Counterfactual Explanations for General User Preferences on Variable Machine Learning Systems
por: Wang, Ming, et al.
Publicado: (2023) -
Language Models as Continuous Self-Evolving Data Engineers
por: Wang, Peidong, et al.
Publicado: (2024) -
Hierarchical Retrieval-Augmented Generation Model with Rethink for Multi-hop Question Answering
por: Zhang, Xiaoming, et al.
Publicado: (2024) -
AnnaAgent: Dynamic Evolution Agent System with Multi-Session Memory for Realistic Seeker Simulation
por: Wang, Ming, et al.
Publicado: (2025)