Discovering Knowledge Deficiencies of Language Models on Massive Knowledge Base
Fuente:
arXiv
Saved in:
| Main Authors: | Song, Linxin, Ding, Xuwei, Zhang, Jieyu, Shi, Taiwei, Shimizu, Ryotaro, Gupta, Rahul, Liu, Yang, Kang, Jian, Zhao, Jieyu |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
The Hallucination Tax of Reinforcement Finetuning
by: Song, Linxin, et al.
Published: (2025)
by: Song, Linxin, et al.
Published: (2025)
Video-Based Reward Modeling for Computer-Use Agents
by: Song, Linxin, et al.
Published: (2026)
by: Song, Linxin, et al.
Published: (2026)
Safer-Instruct: Aligning Language Models with Automated Preference Data
by: Shi, Taiwei, et al.
Published: (2023)
by: Shi, Taiwei, et al.
Published: (2023)
Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
by: Shi, Taiwei, et al.
Published: (2025)
by: Shi, Taiwei, et al.
Published: (2025)
The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents
by: Ding, Xuwei, et al.
Published: (2026)
by: Ding, Xuwei, et al.
Published: (2026)
CoAct-1: Computer-using Multi-Agent System with Coding Actions
by: Song, Linxin, et al.
Published: (2025)
by: Song, Linxin, et al.
Published: (2025)
Experiential Reinforcement Learning
by: Shi, Taiwei, et al.
Published: (2026)
by: Shi, Taiwei, et al.
Published: (2026)
Offline Training of Language Model Agents with Functions as Learnable Weights
by: Zhang, Shaokun, et al.
Published: (2024)
by: Zhang, Shaokun, et al.
Published: (2024)
Adaptive In-conversation Team Building for Language Model Agents
by: Song, Linxin, et al.
Published: (2024)
by: Song, Linxin, et al.
Published: (2024)
Mitigating Bias in Locally Constrained Decoding via Tractable Proposals
by: Dang, Meihua, et al.
Published: (2026)
by: Dang, Meihua, et al.
Published: (2026)
Analyzing Uncertainty of LLM-as-a-Judge: Interval Evaluations with Conformal Prediction
by: Sheng, Huanxin, et al.
Published: (2025)
by: Sheng, Huanxin, et al.
Published: (2025)
Self-Evolving LLM Memory Extraction Across Heterogeneous Tasks
by: Yang, Yuqing, et al.
Published: (2026)
by: Yang, Yuqing, et al.
Published: (2026)
Self-Contradictory Reasoning Evaluation and Detection
by: Liu, Ziyi, et al.
Published: (2023)
by: Liu, Ziyi, et al.
Published: (2023)
Deliberate Planning in Language Models with Symbolic Representation
by: Xiong, Siheng, et al.
Published: (2025)
by: Xiong, Siheng, et al.
Published: (2025)
"You Gotta be a Doctor, Lin": An Investigation of Name-Based Bias of Large Language Models in Employment Recommendations
by: Nghiem, Huy, et al.
Published: (2024)
by: Nghiem, Huy, et al.
Published: (2024)
Detecting and Filtering Unsafe Training Data via Data Attribution with Denoised Representation
by: Pan, Yijun, et al.
Published: (2025)
by: Pan, Yijun, et al.
Published: (2025)
Toward Informal Language Processing: Knowledge of Slang in Large Language Models
by: Sun, Zhewei, et al.
Published: (2024)
by: Sun, Zhewei, et al.
Published: (2024)
Explaining Length Bias in LLM-Based Preference Evaluations
by: Hu, Zhengyu, et al.
Published: (2024)
by: Hu, Zhengyu, et al.
Published: (2024)
Leveraging Large Language Models for Structure Learning in Prompted Weak Supervision
by: Su, Jinyan, et al.
Published: (2024)
by: Su, Jinyan, et al.
Published: (2024)
Converted, Not Equivalent: Benchmarking Codebase Conversion via Observational Equivalence
by: Song, Linxin, et al.
Published: (2026)
by: Song, Linxin, et al.
Published: (2026)
Multilingual Knowledge Graph Completion from Pretrained Language Models with Knowledge Constraints
by: Song, Ran, et al.
Published: (2024)
by: Song, Ran, et al.
Published: (2024)
Can LLMs Grasp Implicit Cultural Values? Benchmarking LLMs' Cultural Intelligence with CQ-Bench
by: Liu, Ziyi, et al.
Published: (2025)
by: Liu, Ziyi, et al.
Published: (2025)
Towards Acyclic Preference Evaluation of Language Models via Multiple Evaluators
by: Hu, Zhengyu, et al.
Published: (2024)
by: Hu, Zhengyu, et al.
Published: (2024)
CLIMB: A Benchmark of Clinical Bias in Large Language Models
by: Zhang, Yubo, et al.
Published: (2024)
by: Zhang, Yubo, et al.
Published: (2024)
Knowledge in Superposition: Unveiling the Failures of Lifelong Knowledge Editing for Large Language Models
by: Hu, Chenhui, et al.
Published: (2024)
by: Hu, Chenhui, et al.
Published: (2024)
Images Speak Louder than Words: Understanding and Mitigating Bias in Vision-Language Model from a Causal Mediation Perspective
by: Weng, Zhaotian, et al.
Published: (2024)
by: Weng, Zhaotian, et al.
Published: (2024)
Discovering Latent Knowledge in Language Models Without Supervision
by: Burns, Collin, et al.
Published: (2022)
by: Burns, Collin, et al.
Published: (2022)
Discovering Knowledge-Critical Subnetworks in Pretrained Language Models
by: Bayazit, Deniz, et al.
Published: (2023)
by: Bayazit, Deniz, et al.
Published: (2023)
Cross-Lingual Pitfalls: Automatic Probing Cross-Lingual Weakness of Multilingual Large Language Models
by: Xu, Zixiang, et al.
Published: (2025)
by: Xu, Zixiang, et al.
Published: (2025)
STEER-BENCH: A Benchmark for Evaluating the Steerability of Large Language Models
by: Chen, Kai, et al.
Published: (2025)
by: Chen, Kai, et al.
Published: (2025)
m&m's: A Benchmark to Evaluate Tool-Use for multi-step multi-modal Tasks
by: Ma, Zixian, et al.
Published: (2024)
by: Ma, Zixian, et al.
Published: (2024)
What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning
by: Weng, Zhaotian, et al.
Published: (2025)
by: Weng, Zhaotian, et al.
Published: (2025)
VisBias: Measuring Explicit and Implicit Social Biases in Vision Language Models
by: Huang, Jen-tse, et al.
Published: (2025)
by: Huang, Jen-tse, et al.
Published: (2025)
"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
by: Gu, Jihao, et al.
Published: (2025)
by: Gu, Jihao, et al.
Published: (2025)
TongGu: Mastering Classical Chinese Understanding with Knowledge-Grounded Large Language Models
by: Cao, Jiahuan, et al.
Published: (2024)
by: Cao, Jiahuan, et al.
Published: (2024)
Efficient Tuning of Large Language Models for Knowledge-Grounded Dialogue Generation
by: Zhang, Bo, et al.
Published: (2025)
by: Zhang, Bo, et al.
Published: (2025)
ProMediate: A Socio-cognitive framework for evaluating proactive agents in multi-party negotiation
by: Liu, Ziyi, et al.
Published: (2025)
by: Liu, Ziyi, et al.
Published: (2025)
Cracking Factual Knowledge: A Comprehensive Analysis of Degenerate Knowledge Neurons in Large Language Models
by: Chen, Yuheng, et al.
Published: (2024)
by: Chen, Yuheng, et al.
Published: (2024)
CogMG: Collaborative Augmentation Between Large Language Model and Knowledge Graph
by: Zhou, Tong, et al.
Published: (2024)
by: Zhou, Tong, et al.
Published: (2024)
MUSE: Machine Unlearning Six-Way Evaluation for Language Models
by: Shi, Weijia, et al.
Published: (2024)
by: Shi, Weijia, et al.
Published: (2024)
Similar Items
-
The Hallucination Tax of Reinforcement Finetuning
by: Song, Linxin, et al.
Published: (2025) -
Video-Based Reward Modeling for Computer-Use Agents
by: Song, Linxin, et al.
Published: (2026) -
Safer-Instruct: Aligning Language Models with Automated Preference Data
by: Shi, Taiwei, et al.
Published: (2023) -
Efficient Reinforcement Finetuning via Adaptive Curriculum Learning
by: Shi, Taiwei, et al.
Published: (2025) -
The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents
by: Ding, Xuwei, et al.
Published: (2026)