Large Language Models Often Say One Thing and Do Another
Fuente:
arXiv
Salvato in:
| Autori principali: | Xu, Ruoxi, Lin, Hongyu, Han, Xianpei, Zheng, Jia, Zhou, Weixiang, Sun, Le, Sun, Yingfei |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2025
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Academically intelligent LLMs are not necessarily socially intelligent
di: Xu, Ruoxi, et al.
Pubblicazione: (2024)
di: Xu, Ruoxi, et al.
Pubblicazione: (2024)
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
di: Liang, Qiao, et al.
Pubblicazione: (2025)
di: Liang, Qiao, et al.
Pubblicazione: (2025)
AI for social science and social science of AI: A Survey
di: Xu, Ruoxi, et al.
Pubblicazione: (2024)
di: Xu, Ruoxi, et al.
Pubblicazione: (2024)
The Life Cycle of Knowledge in Big Language Models: A Survey
di: Cao, Boxi, et al.
Pubblicazione: (2023)
di: Cao, Boxi, et al.
Pubblicazione: (2023)
Executing Natural Language-Described Algorithms with Large Language Models: An Investigation
di: Zheng, Xin, et al.
Pubblicazione: (2024)
di: Zheng, Xin, et al.
Pubblicazione: (2024)
Say One Thing, Do Another? Diagnosing Reasoning-Execution Gaps in VLM-Powered Mobile-Use Agents
di: Dong, Lingzhong, et al.
Pubblicazione: (2025)
di: Dong, Lingzhong, et al.
Pubblicazione: (2025)
Rule or Story, Which is a Better Commonsense Expression for Talking with Large Language Models?
di: Bian, Ning, et al.
Pubblicazione: (2024)
di: Bian, Ning, et al.
Pubblicazione: (2024)
ConsistentChat: Building Skeleton-Guided Consistent Multi-Turn Dialogues for Large Language Models from Scratch
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
di: Chen, Jiawei, et al.
Pubblicazione: (2025)
Memorizing is Not Enough: Deep Knowledge Injection Through Reasoning
di: Xu, Ruoxi, et al.
Pubblicazione: (2025)
di: Xu, Ruoxi, et al.
Pubblicazione: (2025)
Meta-Cognitive Analysis: Evaluating Declarative and Procedural Knowledge in Datasets and Large Language Models
di: Li, Zhuoqun, et al.
Pubblicazione: (2024)
di: Li, Zhuoqun, et al.
Pubblicazione: (2024)
Towards Real-world Human Behavior Simulation: Benchmarking Large Language Models on Long-horizon, Cross-scenario, Heterogeneous Behavior Traces
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
di: Chen, Jiawei, et al.
Pubblicazione: (2026)
ShortV: Efficient Multimodal Large Language Models by Freezing Visual Tokens in Ineffective Layers
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
SAISA: Towards Multimodal Large Language Models with Both Training and Inference Efficiency
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
di: Yuan, Qianhao, et al.
Pubblicazione: (2025)
PPTAgent: Generating and Evaluating Presentations Beyond Text-to-Slides
di: Zheng, Hao, et al.
Pubblicazione: (2025)
di: Zheng, Hao, et al.
Pubblicazione: (2025)
Self-Steering Optimization: Autonomous Preference Optimization for Large Language Models
di: Xiang, Hao, et al.
Pubblicazione: (2024)
di: Xiang, Hao, et al.
Pubblicazione: (2024)
Match, Compare, or Select? An Investigation of Large Language Models for Entity Matching
di: Wang, Tianshu, et al.
Pubblicazione: (2024)
di: Wang, Tianshu, et al.
Pubblicazione: (2024)
ChatGPT is a Knowledgeable but Inexperienced Solver: An Investigation of Commonsense Problem in Large Language Models
di: Bian, Ning, et al.
Pubblicazione: (2023)
di: Bian, Ning, et al.
Pubblicazione: (2023)
Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
The Rise and Down of Babel Tower: Investigating the Evolution Process of Multilingual Code Large Language Model
di: Chen, Jiawei, et al.
Pubblicazione: (2024)
di: Chen, Jiawei, et al.
Pubblicazione: (2024)
StructEval: Deepen and Broaden Large Language Model Assessment via Structured Evaluation
di: Cao, Boxi, et al.
Pubblicazione: (2024)
di: Cao, Boxi, et al.
Pubblicazione: (2024)
DeepRAG: Thinking to Retrieve Step by Step for Large Language Models
di: Guan, Xinyan, et al.
Pubblicazione: (2025)
di: Guan, Xinyan, et al.
Pubblicazione: (2025)
Social Simulations with Large Language Model Risk Utopian Illusion
di: Bian, Ning, et al.
Pubblicazione: (2025)
di: Bian, Ning, et al.
Pubblicazione: (2025)
AI-Salesman: Towards Reliable Large Language Model Driven Telemarketing
di: Zhang, Qingyu, et al.
Pubblicazione: (2025)
di: Zhang, Qingyu, et al.
Pubblicazione: (2025)
Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
di: Liu, Yanjiang, et al.
Pubblicazione: (2025)
A Unified View of Delta Parameter Editing in Post-Trained Large-Scale Models
di: Tang, Qiaoyu, et al.
Pubblicazione: (2024)
di: Tang, Qiaoyu, et al.
Pubblicazione: (2024)
ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models
di: Zheng, Jiasheng, et al.
Pubblicazione: (2026)
di: Zheng, Jiasheng, et al.
Pubblicazione: (2026)
Not All Contexts Are Equal: Teaching LLMs Credibility-aware Generation
di: Pan, Ruotong, et al.
Pubblicazione: (2024)
di: Pan, Ruotong, et al.
Pubblicazione: (2024)
REInstruct: Building Instruction Data from Unlabeled Corpus
di: Chen, Shu, et al.
Pubblicazione: (2024)
di: Chen, Shu, et al.
Pubblicazione: (2024)
Open Grounded Planning: Challenges and Benchmark Construction
di: Guo, Shiguang, et al.
Pubblicazione: (2024)
di: Guo, Shiguang, et al.
Pubblicazione: (2024)
Multi-Facet Counterfactual Learning for Content Quality Evaluation
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
di: Zheng, Jiasheng, et al.
Pubblicazione: (2024)
Self-Retrieval: End-to-End Information Retrieval with One Large Language Model
di: Tang, Qiaoyu, et al.
Pubblicazione: (2024)
di: Tang, Qiaoyu, et al.
Pubblicazione: (2024)
URL: Universal Referential Knowledge Linking via Task-instructed Representation Compression
di: Li, Zhuoqun, et al.
Pubblicazione: (2024)
di: Li, Zhuoqun, et al.
Pubblicazione: (2024)
READoc: A Unified Benchmark for Realistic Document Structured Extraction
di: Li, Zichao, et al.
Pubblicazione: (2024)
di: Li, Zichao, et al.
Pubblicazione: (2024)
Say What You Mean: Natural Language Access Control with Large Language Models for Internet of Things
di: Cheng, Ye, et al.
Pubblicazione: (2025)
di: Cheng, Ye, et al.
Pubblicazione: (2025)
ShortGPT: Layers in Large Language Models are More Redundant Than You Expect
di: Men, Xin, et al.
Pubblicazione: (2024)
di: Men, Xin, et al.
Pubblicazione: (2024)
LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents
di: Peng, Xiaoxuan, et al.
Pubblicazione: (2026)
di: Peng, Xiaoxuan, et al.
Pubblicazione: (2026)
DBCopilot: Natural Language Querying over Massive Databases via Schema Routing
di: Wang, Tianshu, et al.
Pubblicazione: (2023)
di: Wang, Tianshu, et al.
Pubblicazione: (2023)
RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback
di: Tang, Qiaoyu, et al.
Pubblicazione: (2025)
di: Tang, Qiaoyu, et al.
Pubblicazione: (2025)
When Models Outthink Their Safety: Unveiling and Mitigating Self-Jailbreak in Large Reasoning Models
di: Mao, Yingzhi, et al.
Pubblicazione: (2025)
di: Mao, Yingzhi, et al.
Pubblicazione: (2025)
Towards Universal Dense Blocking for Entity Resolution
di: Wang, Tianshu, et al.
Pubblicazione: (2024)
di: Wang, Tianshu, et al.
Pubblicazione: (2024)
Documenti analoghi
-
Academically intelligent LLMs are not necessarily socially intelligent
di: Xu, Ruoxi, et al.
Pubblicazione: (2024) -
Expanding the Boundaries of Vision Prior Knowledge in Multi-modal Large Language Models
di: Liang, Qiao, et al.
Pubblicazione: (2025) -
AI for social science and social science of AI: A Survey
di: Xu, Ruoxi, et al.
Pubblicazione: (2024) -
The Life Cycle of Knowledge in Big Language Models: A Survey
di: Cao, Boxi, et al.
Pubblicazione: (2023) -
Executing Natural Language-Described Algorithms with Large Language Models: An Investigation
di: Zheng, Xin, et al.
Pubblicazione: (2024)