Evaluating LLMs on Chinese Topic Constructions: A Research Proposal Inspired by Tian et al. (2024)
Fuente:
arXiv
Guardado en:
| Autor principal: | Yang, Xiaodong |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Evaluating LLMs on Chinese Idiom Translation
por: Yang, Cai, et al.
Publicado: (2025)
por: Yang, Cai, et al.
Publicado: (2025)
Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination
por: Gao, Lirong, et al.
Publicado: (2026)
por: Gao, Lirong, et al.
Publicado: (2026)
A Topic-aware Comparable Corpus of Chinese Variations
por: Lian, Da-Chen, et al.
Publicado: (2024)
por: Lian, Da-Chen, et al.
Publicado: (2024)
The performances of the Chinese and U.S. Large Language Models on the Topic of Chinese Culture
por: Liu, Feiyan, et al.
Publicado: (2026)
por: Liu, Feiyan, et al.
Publicado: (2026)
TianHui: A Domain-Specific Large Language Model for Diverse Traditional Chinese Medicine Scenarios
por: Yin, Ji, et al.
Publicado: (2025)
por: Yin, Ji, et al.
Publicado: (2025)
TofuEval: Evaluating Hallucinations of LLMs on Topic-Focused Dialogue Summarization
por: Tang, Liyan, et al.
Publicado: (2024)
por: Tang, Liyan, et al.
Publicado: (2024)
Unveiling the Competitive Dynamics: A Comparative Evaluation of American and Chinese LLMs
por: Jiang, Zhenhui, et al.
Publicado: (2024)
por: Jiang, Zhenhui, et al.
Publicado: (2024)
Interdisciplinary Fairness in Imbalanced Research Proposal Topic Inference: A Hierarchical Transformer-based Method with Selective Interpolation
por: Xiao, Meng, et al.
Publicado: (2023)
por: Xiao, Meng, et al.
Publicado: (2023)
Proposal Report for the 2nd SciCAP Competition 2024
por: Li, Pengpeng, et al.
Publicado: (2024)
por: Li, Pengpeng, et al.
Publicado: (2024)
Addressing Topic Leakage in Cross-Topic Evaluation for Authorship Verification
por: Sawatphol, Jitkapat, et al.
Publicado: (2024)
por: Sawatphol, Jitkapat, et al.
Publicado: (2024)
Topic-Controllable Summarization: Topic-Aware Evaluation and Transformer Methods
por: Passali, Tatiana, et al.
Publicado: (2022)
por: Passali, Tatiana, et al.
Publicado: (2022)
ClinConsensus: A Physician-Calibrated Benchmark for Evaluating Clinical Rubric Coverage in Chinese Medical LLMs
por: Zheng, Xiang, et al.
Publicado: (2026)
por: Zheng, Xiang, et al.
Publicado: (2026)
Evaluating Distributed Representations for Multi-Level Lexical Semantics: A Research Proposal
por: Liu, Zhu
Publicado: (2024)
por: Liu, Zhu
Publicado: (2024)
WHBench: Evaluating Frontier LLMs with Expert-in-the-Loop Validation on Women's Health Topics
por: Maurya, Sneha, et al.
Publicado: (2026)
por: Maurya, Sneha, et al.
Publicado: (2026)
Proposing Topic Models and Evaluation Frameworks for Analyzing Associations with External Outcomes: An Application to Leadership Analysis Using Large-Scale Corporate Review Data
por: Yoshida, Yura, et al.
Publicado: (2026)
por: Yoshida, Yura, et al.
Publicado: (2026)
LLMs Are Not Intelligent Thinkers: Introducing Mathematical Topic Tree Benchmark for Comprehensive Evaluation of LLMs
por: Davoodi, Arash Gholami, et al.
Publicado: (2024)
por: Davoodi, Arash Gholami, et al.
Publicado: (2024)
Advancing Topic Segmentation and Outline Generation in Chinese Texts: The Paragraph-level Topic Representation, Corpus, and Benchmark
por: Jiang, Feng, et al.
Publicado: (2023)
por: Jiang, Feng, et al.
Publicado: (2023)
Context is Key(NMF): Modelling Topical Information Dynamics in Chinese Diaspora Media
por: Kristensen-McLachlan, Ross Deans, et al.
Publicado: (2024)
por: Kristensen-McLachlan, Ross Deans, et al.
Publicado: (2024)
Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge
por: Cai, Yunna, et al.
Publicado: (2025)
por: Cai, Yunna, et al.
Publicado: (2025)
ChineseSafe: A Chinese Benchmark for Evaluating Safety in Large Language Models
por: Zhang, Hengxiang, et al.
Publicado: (2024)
por: Zhang, Hengxiang, et al.
Publicado: (2024)
CDTP: A Large-Scale Chinese Data-Text Pair Dataset for Comprehensive Evaluation of Chinese LLMs
por: Wu, Chengwei, et al.
Publicado: (2025)
por: Wu, Chengwei, et al.
Publicado: (2025)
NaturalConv: A Chinese Dialogue Dataset Towards Multi-turn Topic-driven Conversation
por: Wang, Xiaoyang, et al.
Publicado: (2021)
por: Wang, Xiaoyang, et al.
Publicado: (2021)
CSSBench: Evaluating the Safety of Lightweight LLMs against Chinese-Specific Adversarial Patterns
por: Zhou, Zhenhong, et al.
Publicado: (2026)
por: Zhou, Zhenhong, et al.
Publicado: (2026)
Can AI Write Classical Chinese Poetry like Humans? An Empirical Study Inspired by Turing Test
por: Deng, Zekun, et al.
Publicado: (2024)
por: Deng, Zekun, et al.
Publicado: (2024)
Holistic Evaluations of Topic Models
por: Compton, Thomas
Publicado: (2025)
por: Compton, Thomas
Publicado: (2025)
QualBench: Benchmarking Chinese LLMs with Localized Professional Qualifications for Vertical Domain Evaluation
por: Hong, Mengze, et al.
Publicado: (2025)
por: Hong, Mengze, et al.
Publicado: (2025)
Topic-Guided Reinforcement Learning with LLMs for Enhancing Multi-Document Summarization
por: Li, Chuyuan, et al.
Publicado: (2025)
por: Li, Chuyuan, et al.
Publicado: (2025)
Analyzing Cancer Patients' Experiences with Embedding-based Topic Modeling and LLMs
por: Ionescu, Teodor-Călin, et al.
Publicado: (2026)
por: Ionescu, Teodor-Călin, et al.
Publicado: (2026)
Hierarchical Graph Topic Modeling with Topic Tree-based Transformer
por: Zhang, Delvin Ce, et al.
Publicado: (2025)
por: Zhang, Delvin Ce, et al.
Publicado: (2025)
Assisting Research Proposal Writing with Large Language Models: Evaluation and Refinement
por: Ren, Jing, et al.
Publicado: (2025)
por: Ren, Jing, et al.
Publicado: (2025)
Automatic Construction of Chinese Verb Collostruction Database
por: Tang, Xuri, et al.
Publicado: (2025)
por: Tang, Xuri, et al.
Publicado: (2025)
Topic Modeling with Fine-tuning LLMs and Bag of Sentences
por: Schneider, Johannes
Publicado: (2024)
por: Schneider, Johannes
Publicado: (2024)
Comprehensive Evaluation of Large Language Models for Topic Modeling
por: Doi, Tomoki, et al.
Publicado: (2024)
por: Doi, Tomoki, et al.
Publicado: (2024)
Are LLMs Effective Backbones for Fine-tuning? An Experimental Investigation of Supervised LLMs on Chinese Short Text Matching
por: Liu, Shulin, et al.
Publicado: (2024)
por: Liu, Shulin, et al.
Publicado: (2024)
TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice
por: Hu, Gang, et al.
Publicado: (2026)
por: Hu, Gang, et al.
Publicado: (2026)
LLM Reading Tea Leaves: Automatically Evaluating Topic Models with Large Language Models
por: Yang, Xiaohao, et al.
Publicado: (2024)
por: Yang, Xiaohao, et al.
Publicado: (2024)
Evaluating CxG Generalisation in LLMs via Construction-Based NLI Fine Tuning
por: Mackintosh, Tom, et al.
Publicado: (2025)
por: Mackintosh, Tom, et al.
Publicado: (2025)
A Neural Topic Method Using a Large-Language-Model-in-the-Loop for Business Research
por: Ludwig, Stephan, et al.
Publicado: (2026)
por: Ludwig, Stephan, et al.
Publicado: (2026)
TopicGPT: A Prompt-based Topic Modeling Framework
por: Pham, Chau Minh, et al.
Publicado: (2023)
por: Pham, Chau Minh, et al.
Publicado: (2023)
DeepResearchEval: An Automated Framework for Deep Research Task Construction and Agentic Evaluation
por: Wang, Yibo, et al.
Publicado: (2026)
por: Wang, Yibo, et al.
Publicado: (2026)
Ejemplares similares
-
Evaluating LLMs on Chinese Idiom Translation
por: Yang, Cai, et al.
Publicado: (2025) -
Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination
por: Gao, Lirong, et al.
Publicado: (2026) -
A Topic-aware Comparable Corpus of Chinese Variations
por: Lian, Da-Chen, et al.
Publicado: (2024) -
The performances of the Chinese and U.S. Large Language Models on the Topic of Chinese Culture
por: Liu, Feiyan, et al.
Publicado: (2026) -
TianHui: A Domain-Specific Large Language Model for Diverse Traditional Chinese Medicine Scenarios
por: Yin, Ji, et al.
Publicado: (2025)