An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Zongjie, Qiu, Wenying, Ma, Pingchuan, Li, Yichen, Li, You, He, Sijia, Jiang, Baozheng, Wang, Shuai, Gu, Weixi |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models
par: Wang, Xunguang, et autres
Publié: (2023)
par: Wang, Xunguang, et autres
Publié: (2023)
Measuring and Augmenting Large Language Models for Solving Capture-the-Flag Challenges
par: Ji, Zimo, et autres
Publié: (2025)
par: Ji, Zimo, et autres
Publié: (2025)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
par: Wang, Xunguang, et autres
Publié: (2025)
par: Wang, Xunguang, et autres
Publié: (2025)
Testing and Understanding Erroneous Planning in LLM Agents through Synthesized User Inputs
par: Ji, Zhenlan, et autres
Publié: (2024)
par: Ji, Zhenlan, et autres
Publié: (2024)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
par: Li, Zongjie, et autres
Publié: (2026)
par: Li, Zongjie, et autres
Publié: (2026)
Empirical Study of Code Large Language Models for Binary Security Patch Detection
par: Li, Qingyuan, et autres
Publié: (2025)
par: Li, Qingyuan, et autres
Publié: (2025)
SkillReducer: Optimizing LLM Agent Skills for Token Efficiency
par: Gao, Yudong, et autres
Publié: (2026)
par: Gao, Yudong, et autres
Publié: (2026)
Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models
par: Wang, Xunguang, et autres
Publié: (2026)
par: Wang, Xunguang, et autres
Publié: (2026)
How Multi-Modal LLMs Reshape Visual Deep Learning Testing? A Comprehensive Study Through the Lens of Image Mutation
par: Wang, Liwen, et autres
Publié: (2024)
par: Wang, Liwen, et autres
Publié: (2024)
OpenVNA: A Framework for Analyzing the Behavior of Multimodal Language Understanding System under Noisy Scenarios
par: Yuan, Ziqi, et autres
Publié: (2024)
par: Yuan, Ziqi, et autres
Publié: (2024)
Taming Various Privilege Escalation in LLM-Based Agent Systems: A Mandatory Access Control Framework
par: Ji, Zimo, et autres
Publié: (2026)
par: Ji, Zimo, et autres
Publié: (2026)
Split and Merge: Aligning Position Biases in LLM-based Evaluators
par: Li, Zongjie, et autres
Publié: (2023)
par: Li, Zongjie, et autres
Publié: (2023)
Reasoning as a Resource: Optimizing Fast and Slow Thinking in Code Generation Models
par: Li, Zongjie, et autres
Publié: (2025)
par: Li, Zongjie, et autres
Publié: (2025)
EAMET: Robust Massive Model Editing via Embedding Alignment Optimization
par: Dai, Yanbo, et autres
Publié: (2025)
par: Dai, Yanbo, et autres
Publié: (2025)
API-guided Dataset Synthesis to Finetune Large Code Models
par: Li, Zongjie, et autres
Publié: (2024)
par: Li, Zongjie, et autres
Publié: (2024)
Do Large Language Models have Problem-Solving Capability under Incomplete Information Scenarios?
par: Chen, Yuyan, et autres
Publié: (2024)
par: Chen, Yuyan, et autres
Publié: (2024)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
par: Wang, Xunguang, et autres
Publié: (2025)
par: Wang, Xunguang, et autres
Publié: (2025)
Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks
par: Ji, Zimo, et autres
Publié: (2025)
par: Ji, Zimo, et autres
Publié: (2025)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
par: Wang, Xunguang, et autres
Publié: (2024)
par: Wang, Xunguang, et autres
Publié: (2024)
Toward Intelligent Electronic-Photonic Design Automation for Large-Scale Photonic Integrated Circuits: from Device Inverse Design to Physical Layout Generation
par: Zhou, Hongjian, et autres
Publié: (2025)
par: Zhou, Hongjian, et autres
Publié: (2025)
Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios
par: Dang, Yunkai, et autres
Publié: (2024)
par: Dang, Yunkai, et autres
Publié: (2024)
Design and Empirical Study of a Large Language Model-Based Multi-Agent Investment System for Chinese Public REITs
par: Li, Zheng
Publié: (2026)
par: Li, Zheng
Publié: (2026)
Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study
par: Hou, Guanyu, et autres
Publié: (2025)
par: Hou, Guanyu, et autres
Publié: (2025)
Beyond Accuracy: An Empirical Study on Unit Testing in Open-source Deep Learning Projects
par: Wang, Han, et autres
Publié: (2024)
par: Wang, Han, et autres
Publié: (2024)
Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode
par: Ji, Zimo, et autres
Publié: (2026)
par: Ji, Zimo, et autres
Publié: (2026)
Toward Adaptive Reasoning in Large Language Models with Thought Rollback
par: Chen, Sijia, et autres
Publié: (2024)
par: Chen, Sijia, et autres
Publié: (2024)
Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
par: Li, Zongjie, et autres
Publié: (2025)
par: Li, Zongjie, et autres
Publié: (2025)
SEAL: Subspace-Anchored Watermarks for LLM Ownership
par: Dai, Yanbo, et autres
Publié: (2025)
par: Dai, Yanbo, et autres
Publié: (2025)
TianHui: A Domain-Specific Large Language Model for Diverse Traditional Chinese Medicine Scenarios
par: Yin, Ji, et autres
Publié: (2025)
par: Yin, Ji, et autres
Publié: (2025)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
par: Ouyang, Zetian, et autres
Publié: (2024)
par: Ouyang, Zetian, et autres
Publié: (2024)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
par: Li, Wei, et autres
Publié: (2024)
par: Li, Wei, et autres
Publié: (2024)
Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning
par: Dai, Yanbo, et autres
Publié: (2025)
par: Dai, Yanbo, et autres
Publié: (2025)
CodeJudge: Evaluating Code Generation with Large Language Models
par: Tong, Weixi, et autres
Publié: (2024)
par: Tong, Weixi, et autres
Publié: (2024)
Network simulation tools for unmanned aerial vehicle communications: A survey
par: Weiwei Jiang, et autres
Publié: (2024)
par: Weiwei Jiang, et autres
Publié: (2024)
Feature engineering vs. deep learning for paper section identification: Toward applications in Chinese medical literature
par: Zhou, Sijia, et autres
Publié: (2024)
par: Zhou, Sijia, et autres
Publié: (2024)
On the (In)Effectiveness of Large Language Models for Chinese Text Correction
par: Li, Yinghui, et autres
Publié: (2023)
par: Li, Yinghui, et autres
Publié: (2023)
From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation
par: Xue, Zhantong, et autres
Publié: (2025)
par: Xue, Zhantong, et autres
Publié: (2025)
Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation
par: Li, Chengze, et autres
Publié: (2025)
par: Li, Chengze, et autres
Publié: (2025)
Exploring the Effectiveness of LLMs in Automated Logging Generation: An Empirical Study
par: Li, Yichen, et autres
Publié: (2023)
par: Li, Yichen, et autres
Publié: (2023)
Large Language Models for Automated Web-Form-Test Generation: An Empirical Study
par: Li, Tao, et autres
Publié: (2024)
par: Li, Tao, et autres
Publié: (2024)
Documents similaires
-
InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models
par: Wang, Xunguang, et autres
Publié: (2023) -
Measuring and Augmenting Large Language Models for Solving Capture-the-Flag Challenges
par: Ji, Zimo, et autres
Publié: (2025) -
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
par: Wang, Xunguang, et autres
Publié: (2025) -
Testing and Understanding Erroneous Planning in LLM Agents through Synthesized User Inputs
par: Ji, Zhenlan, et autres
Publié: (2024) -
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
par: Li, Zongjie, et autres
Publié: (2026)