Guardado en:
| Autores principales: | Gu, Zhouhong, Zhang, Lin, Chen, Jiangjie, Ye, Haoning, Zhu, Xiaoxuan, Li, Zihan, Ye, Zheyu, Gao, Yan, Hu, Yao, Xiao, Yanghua, Feng, Hongwei |
|---|---|
| Formato: | Preprint |
| Publicado: |
2023
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2307.05113 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
por: Gu, Zhouhong, et al.
Publicado: (2024)
por: Gu, Zhouhong, et al.
Publicado: (2024)
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
por: Gu, Zhouhong, et al.
Publicado: (2024)
por: Gu, Zhouhong, et al.
Publicado: (2024)
Efficiently Quantifying and Mitigating Ripple Effects in Model Editing
por: Wang, Jianchen, et al.
Publicado: (2024)
por: Wang, Jianchen, et al.
Publicado: (2024)
AgentGroupChat: An Interactive Group Chat Simulacra For Better Eliciting Emergent Behavior
por: Gu, Zhouhong, et al.
Publicado: (2024)
por: Gu, Zhouhong, et al.
Publicado: (2024)
RECKON: Large-scale Reference-based Efficient Knowledge Evaluation for Large Language Model
por: Zhang, Lin, et al.
Publicado: (2025)
por: Zhang, Lin, et al.
Publicado: (2025)
VCEval: Rethinking What is a Good Educational Video and How to Automatically Evaluate It
por: Zhu, Xiaoxuan, et al.
Publicado: (2024)
por: Zhu, Xiaoxuan, et al.
Publicado: (2024)
Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation
por: Gu, Zhouhong, et al.
Publicado: (2023)
por: Gu, Zhouhong, et al.
Publicado: (2023)
MIRAGE: Exploring How Large Language Models Perform in Complex Social Interactive Environments
por: Cai, Yin, et al.
Publicado: (2025)
por: Cai, Yin, et al.
Publicado: (2025)
LLM-GAN: Construct Generative Adversarial Network Through Large Language Models For Explainable Fake News Detection
por: Wang, Yifeng, et al.
Publicado: (2024)
por: Wang, Yifeng, et al.
Publicado: (2024)
ToReMi: Topic-Aware Data Reweighting for Dynamic Pre-Training Data Selection
por: Zhu, Xiaoxuan, et al.
Publicado: (2025)
por: Zhu, Xiaoxuan, et al.
Publicado: (2025)
LITE: LLM-Impelled efficient Taxonomy Evaluation
por: Zhang, Lin, et al.
Publicado: (2025)
por: Zhang, Lin, et al.
Publicado: (2025)
AgentGroupChat-V2: Divide-and-Conquer Is What LLM-Based Multi-Agent System Need
por: Gu, Zhouhong, et al.
Publicado: (2025)
por: Gu, Zhouhong, et al.
Publicado: (2025)
Can Large Language Models Understand Real-World Complex Instructions?
por: He, Qianyu, et al.
Publicado: (2023)
por: He, Qianyu, et al.
Publicado: (2023)
Enhancing Language Agent Strategic Reasoning through Self-Play in Adversarial Games
por: Zhang, Yikai, et al.
Publicado: (2025)
por: Zhang, Yikai, et al.
Publicado: (2025)
GAPO: Learning Preferential Prompt through Generative Adversarial Policy Optimization
por: Gu, Zhouhong, et al.
Publicado: (2025)
por: Gu, Zhouhong, et al.
Publicado: (2025)
ConcEPT: Concept-Enhanced Pre-Training for Language Models
por: Wang, Xintao, et al.
Publicado: (2024)
por: Wang, Xintao, et al.
Publicado: (2024)
Scaling Behavior of Single LLM-Driven Multi-Agent Systems
por: Li, Jialing, et al.
Publicado: (2026)
por: Li, Jialing, et al.
Publicado: (2026)
How Easily do Irrelevant Inputs Skew the Responses of Large Language Models?
por: Wu, Siye, et al.
Publicado: (2024)
por: Wu, Siye, et al.
Publicado: (2024)
ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research
por: Shen, Hao, et al.
Publicado: (2026)
por: Shen, Hao, et al.
Publicado: (2026)
TimeArena: Shaping Efficient Multitasking Language Agents in a Time-Aware Simulation
por: Zhang, Yikai, et al.
Publicado: (2024)
por: Zhang, Yikai, et al.
Publicado: (2024)
Past Meets Present: Creating Historical Analogy with Large Language Models
por: Li, Nianqi, et al.
Publicado: (2024)
por: Li, Nianqi, et al.
Publicado: (2024)
TravelPlanner: A Benchmark for Real-World Planning with Language Agents
por: Xie, Jian, et al.
Publicado: (2024)
por: Xie, Jian, et al.
Publicado: (2024)
Dr.Academy: A Benchmark for Evaluating Questioning Capability in Education for Large Language Models
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
MCiteBench: A Multimodal Benchmark for Generating Text with Citations
por: Hu, Caiyu, et al.
Publicado: (2025)
por: Hu, Caiyu, et al.
Publicado: (2025)
GumbelSoft: Diversified Language Model Watermarking via the GumbelMax-trick
por: Fu, Jiayi, et al.
Publicado: (2024)
por: Fu, Jiayi, et al.
Publicado: (2024)
ANALOGYKB: Unlocking Analogical Reasoning of Language Models with A Million-scale Knowledge Base
por: Yuan, Siyu, et al.
Publicado: (2023)
por: Yuan, Siyu, et al.
Publicado: (2023)
Towards the Law of Capacity Gap in Distilling Language Models
por: Zhang, Chen, et al.
Publicado: (2023)
por: Zhang, Chen, et al.
Publicado: (2023)
TravelAgent: An AI Assistant for Personalized Travel Planning
por: Chen, Aili, et al.
Publicado: (2024)
por: Chen, Aili, et al.
Publicado: (2024)
TESSELLATE: Piecing Together the Variable Sky With TESS
por: Roxburgh, Hugh, et al.
Publicado: (2025)
por: Roxburgh, Hugh, et al.
Publicado: (2025)
Embedded Course Reserves: Piecing the Puzzle Together
por: Clumpner, Krista E., et al.
Publicado: (2011)
por: Clumpner, Krista E., et al.
Publicado: (2011)
Recent Advancement of Emotion Cognition in Large Language Models
por: Chen, Yuyan, et al.
Publicado: (2024)
por: Chen, Yuyan, et al.
Publicado: (2024)
GAUSS: Benchmarking Structured Mathematical Skills for Large Language Models
por: Zhang, Yue, et al.
Publicado: (2025)
por: Zhang, Yue, et al.
Publicado: (2025)
AutoScraper: A Progressive Understanding Web Agent for Web Scraper Generation
por: Huang, Wenhao, et al.
Publicado: (2024)
por: Huang, Wenhao, et al.
Publicado: (2024)
Piece it Together: Part-Based Concepting with IP-Priors
por: Richardson, Elad, et al.
Publicado: (2025)
por: Richardson, Elad, et al.
Publicado: (2025)
Enhancing Quantitative Reasoning Skills of Large Language Models through Dimension Perception
por: Huang, Yuncheng, et al.
Publicado: (2023)
por: Huang, Yuncheng, et al.
Publicado: (2023)
Revealing the Barriers of Language Agents in Planning
por: Xie, Jian, et al.
Publicado: (2024)
por: Xie, Jian, et al.
Publicado: (2024)
Piecing It All Together: Verifying Multi-Hop Multimodal Claims
por: Wang, Haoran, et al.
Publicado: (2024)
por: Wang, Haoran, et al.
Publicado: (2024)
Fitting the Pieces Together: Developing Better Service for End-Users.
por: Bridges, Peggy Bass, et al.
Publicado: (2000)
por: Bridges, Peggy Bass, et al.
Publicado: (2000)
Layer as Puzzle Pieces: Compressing Large Language Models through Layer Concatenation
por: Wang, Fei, et al.
Publicado: (2025)
por: Wang, Fei, et al.
Publicado: (2025)
Ejemplares similares
-
DetectBench: Can Large Language Model Detect and Piece Together Implicit Evidence?
por: Gu, Zhouhong, et al.
Publicado: (2024) -
StrucText-Eval: Evaluating Large Language Model's Reasoning Ability in Structure-Rich Text
por: Gu, Zhouhong, et al.
Publicado: (2024) -
Efficiently Quantifying and Mitigating Ripple Effects in Model Editing
por: Wang, Jianchen, et al.
Publicado: (2024) -
AgentGroupChat: An Interactive Group Chat Simulacra For Better Eliciting Emergent Behavior
por: Gu, Zhouhong, et al.
Publicado: (2024) -
RECKON: Large-scale Reference-based Efficient Knowledge Evaluation for Large Language Model
por: Zhang, Lin, et al.
Publicado: (2025)