An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios
Fuente:
arXiv
Gespeichert in:
| Hauptverfasser: | Li, Zongjie, Qiu, Wenying, Ma, Pingchuan, Li, Yichen, Li, You, He, Sijia, Jiang, Baozheng, Wang, Shuai, Gu, Weixi |
|---|---|
| Format: | Preprint |
| Veröffentlicht: |
2024
|
| Schlagworte: | |
| Online-Zugang: | |
| Tags: |
Tag hinzufügen
Keine Tags, Fügen Sie den ersten Tag hinzu!
|
Ähnliche Einträge
InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2023)
von: Wang, Xunguang, et al.
Veröffentlicht: (2023)
Measuring and Augmenting Large Language Models for Solving Capture-the-Flag Challenges
von: Ji, Zimo, et al.
Veröffentlicht: (2025)
von: Ji, Zimo, et al.
Veröffentlicht: (2025)
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
Testing and Understanding Erroneous Planning in LLM Agents through Synthesized User Inputs
von: Ji, Zhenlan, et al.
Veröffentlicht: (2024)
von: Ji, Zhenlan, et al.
Veröffentlicht: (2024)
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
von: Li, Zongjie, et al.
Veröffentlicht: (2026)
von: Li, Zongjie, et al.
Veröffentlicht: (2026)
Empirical Study of Code Large Language Models for Binary Security Patch Detection
von: Li, Qingyuan, et al.
Veröffentlicht: (2025)
von: Li, Qingyuan, et al.
Veröffentlicht: (2025)
SkillReducer: Optimizing LLM Agent Skills for Token Efficiency
von: Gao, Yudong, et al.
Veröffentlicht: (2026)
von: Gao, Yudong, et al.
Veröffentlicht: (2026)
Beyond Content Safety: Real-Time Monitoring for Reasoning Vulnerabilities in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2026)
von: Wang, Xunguang, et al.
Veröffentlicht: (2026)
How Multi-Modal LLMs Reshape Visual Deep Learning Testing? A Comprehensive Study Through the Lens of Image Mutation
von: Wang, Liwen, et al.
Veröffentlicht: (2024)
von: Wang, Liwen, et al.
Veröffentlicht: (2024)
OpenVNA: A Framework for Analyzing the Behavior of Multimodal Language Understanding System under Noisy Scenarios
von: Yuan, Ziqi, et al.
Veröffentlicht: (2024)
von: Yuan, Ziqi, et al.
Veröffentlicht: (2024)
Taming Various Privilege Escalation in LLM-Based Agent Systems: A Mandatory Access Control Framework
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
Split and Merge: Aligning Position Biases in LLM-based Evaluators
von: Li, Zongjie, et al.
Veröffentlicht: (2023)
von: Li, Zongjie, et al.
Veröffentlicht: (2023)
Reasoning as a Resource: Optimizing Fast and Slow Thinking in Code Generation Models
von: Li, Zongjie, et al.
Veröffentlicht: (2025)
von: Li, Zongjie, et al.
Veröffentlicht: (2025)
EAMET: Robust Massive Model Editing via Embedding Alignment Optimization
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
API-guided Dataset Synthesis to Finetune Large Code Models
von: Li, Zongjie, et al.
Veröffentlicht: (2024)
von: Li, Zongjie, et al.
Veröffentlicht: (2024)
Do Large Language Models have Problem-Solving Capability under Incomplete Information Scenarios?
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
von: Chen, Yuyan, et al.
Veröffentlicht: (2024)
SoK: Evaluating Jailbreak Guardrails for Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
von: Wang, Xunguang, et al.
Veröffentlicht: (2025)
Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks
von: Ji, Zimo, et al.
Veröffentlicht: (2025)
von: Ji, Zimo, et al.
Veröffentlicht: (2025)
SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner
von: Wang, Xunguang, et al.
Veröffentlicht: (2024)
von: Wang, Xunguang, et al.
Veröffentlicht: (2024)
Toward Intelligent Electronic-Photonic Design Automation for Large-Scale Photonic Integrated Circuits: from Device Inverse Design to Physical Layout Generation
von: Zhou, Hongjian, et al.
Veröffentlicht: (2025)
von: Zhou, Hongjian, et al.
Veröffentlicht: (2025)
Exploring Response Uncertainty in MLLMs: An Empirical Evaluation under Misleading Scenarios
von: Dang, Yunkai, et al.
Veröffentlicht: (2024)
von: Dang, Yunkai, et al.
Veröffentlicht: (2024)
Design and Empirical Study of a Large Language Model-Based Multi-Agent Investment System for Chinese Public REITs
von: Li, Zheng
Veröffentlicht: (2026)
von: Li, Zheng
Veröffentlicht: (2026)
Evaluating Robustness of Large Audio Language Models to Audio Injection: An Empirical Study
von: Hou, Guanyu, et al.
Veröffentlicht: (2025)
von: Hou, Guanyu, et al.
Veröffentlicht: (2025)
Beyond Accuracy: An Empirical Study on Unit Testing in Open-source Deep Learning Projects
von: Wang, Han, et al.
Veröffentlicht: (2024)
von: Wang, Han, et al.
Veröffentlicht: (2024)
Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
von: Ji, Zimo, et al.
Veröffentlicht: (2026)
Toward Adaptive Reasoning in Large Language Models with Thought Rollback
von: Chen, Sijia, et al.
Veröffentlicht: (2024)
von: Chen, Sijia, et al.
Veröffentlicht: (2024)
Differentiation-Based Extraction of Proprietary Data from Fine-Tuned LLMs
von: Li, Zongjie, et al.
Veröffentlicht: (2025)
von: Li, Zongjie, et al.
Veröffentlicht: (2025)
SEAL: Subspace-Anchored Watermarks for LLM Ownership
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
TianHui: A Domain-Specific Large Language Model for Diverse Traditional Chinese Medicine Scenarios
von: Yin, Ji, et al.
Veröffentlicht: (2025)
von: Yin, Ji, et al.
Veröffentlicht: (2025)
CliMedBench: A Large-Scale Chinese Benchmark for Evaluating Medical Large Language Models in Clinical Scenarios
von: Ouyang, Zetian, et al.
Veröffentlicht: (2024)
von: Ouyang, Zetian, et al.
Veröffentlicht: (2024)
FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models
von: Li, Wei, et al.
Veröffentlicht: (2024)
von: Li, Wei, et al.
Veröffentlicht: (2024)
Disabling Self-Correction in Retrieval-Augmented Generation via Stealthy Retriever Poisoning
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
von: Dai, Yanbo, et al.
Veröffentlicht: (2025)
CodeJudge: Evaluating Code Generation with Large Language Models
von: Tong, Weixi, et al.
Veröffentlicht: (2024)
von: Tong, Weixi, et al.
Veröffentlicht: (2024)
Network simulation tools for unmanned aerial vehicle communications: A survey
von: Weiwei Jiang, et al.
Veröffentlicht: (2024)
von: Weiwei Jiang, et al.
Veröffentlicht: (2024)
Feature engineering vs. deep learning for paper section identification: Toward applications in Chinese medical literature
von: Zhou, Sijia, et al.
Veröffentlicht: (2024)
von: Zhou, Sijia, et al.
Veröffentlicht: (2024)
On the (In)Effectiveness of Large Language Models for Chinese Text Correction
von: Li, Yinghui, et al.
Veröffentlicht: (2023)
von: Li, Yinghui, et al.
Veröffentlicht: (2023)
From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation
von: Xue, Zhantong, et al.
Veröffentlicht: (2025)
von: Xue, Zhantong, et al.
Veröffentlicht: (2025)
Beyond Autoregression: An Empirical Study of Diffusion Large Language Models for Code Generation
von: Li, Chengze, et al.
Veröffentlicht: (2025)
von: Li, Chengze, et al.
Veröffentlicht: (2025)
Exploring the Effectiveness of LLMs in Automated Logging Generation: An Empirical Study
von: Li, Yichen, et al.
Veröffentlicht: (2023)
von: Li, Yichen, et al.
Veröffentlicht: (2023)
Large Language Models for Automated Web-Form-Test Generation: An Empirical Study
von: Li, Tao, et al.
Veröffentlicht: (2024)
von: Li, Tao, et al.
Veröffentlicht: (2024)
Ähnliche Einträge
-
InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2023) -
Measuring and Augmenting Large Language Models for Solving Capture-the-Flag Challenges
von: Ji, Zimo, et al.
Veröffentlicht: (2025) -
STShield: Single-Token Sentinel for Real-Time Jailbreak Detection in Large Language Models
von: Wang, Xunguang, et al.
Veröffentlicht: (2025) -
Testing and Understanding Erroneous Planning in LLM Agents through Synthesized User Inputs
von: Ji, Zhenlan, et al.
Veröffentlicht: (2024) -
WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making
von: Li, Zongjie, et al.
Veröffentlicht: (2026)