Multi-Scale Manifold Alignment for Interpreting Large Language Models: A Unified Information-Geometric Framework
Fuente:
arXiv
Saved in:
| Main Authors: | Zhang, Yukun, Dong, Qi |
|---|---|
| Format: | Preprint |
| Published: |
2025
|
| Subjects: | |
| Online Access: | |
| Tags: |
Add Tag
No Tags, Be the first to tag this record!
|
Similar Items
Latent Trajectory Dynamics in Large Language Models: A Manifold Evolution Framework with Empirical Validation
by: Zhang, Yukun, et al.
Published: (2025)
by: Zhang, Yukun, et al.
Published: (2025)
Hierarchical Alignment: Surgical Fine-Tuning via Functional Layer Specialization in Large Language Models
by: Zhang, Yukun, et al.
Published: (2025)
by: Zhang, Yukun, et al.
Published: (2025)
Emergent Hierarchical Structure in Large Language Models: An Information-Theoretic Framework for Multi-Scale Representation
by: Zhang, Yukin, et al.
Published: (2025)
by: Zhang, Yukin, et al.
Published: (2025)
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
by: Zhou, Weikang, et al.
Published: (2024)
by: Zhou, Weikang, et al.
Published: (2024)
ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment
by: Masters, Charlie, et al.
Published: (2025)
by: Masters, Charlie, et al.
Published: (2025)
UniMEL: A Unified Framework for Multimodal Entity Linking with Large Language Models
by: Qi, Liu, et al.
Published: (2024)
by: Qi, Liu, et al.
Published: (2024)
Benchmarking Multi-National Value Alignment for Large Language Models
by: Shi, Weijie, et al.
Published: (2025)
by: Shi, Weijie, et al.
Published: (2025)
Information Flow Routes: Automatically Interpreting Language Models at Scale
by: Ferrando, Javier, et al.
Published: (2024)
by: Ferrando, Javier, et al.
Published: (2024)
Multi-objective Large Language Model Alignment with Hierarchical Experts
by: Li, Zhuo, et al.
Published: (2025)
by: Li, Zhuo, et al.
Published: (2025)
Entity Alignment with Noisy Annotations from Large Language Models
by: Chen, Shengyuan, et al.
Published: (2024)
by: Chen, Shengyuan, et al.
Published: (2024)
Unveiling LLM Mechanisms Through Neural ODEs and Control Theory
by: Zhang, Yukun, et al.
Published: (2024)
by: Zhang, Yukun, et al.
Published: (2024)
Comparing Human and Large Language Model Interpretation of Implicit Information
by: De Santis, Antonio, et al.
Published: (2026)
by: De Santis, Antonio, et al.
Published: (2026)
Unified Lexical Representation for Interpretable Visual-Language Alignment
by: Li, Yifan, et al.
Published: (2024)
by: Li, Yifan, et al.
Published: (2024)
A Unified Biomedical Named Entity Recognition Framework with Large Language Models
by: Lv, Tengxiao, et al.
Published: (2025)
by: Lv, Tengxiao, et al.
Published: (2025)
Thinking Before Constraining: A Unified Decoding Framework for Large Language Models
by: Nguyen, Ngoc Trinh Hung, et al.
Published: (2026)
by: Nguyen, Ngoc Trinh Hung, et al.
Published: (2026)
Representations as Language: An Information-Theoretic Framework for Interpretability
by: Conklin, Henry, et al.
Published: (2024)
by: Conklin, Henry, et al.
Published: (2024)
ChemATP: A Training-Free Chemical Reasoning Framework for Large Language Models
by: Zhang, Mingxu, et al.
Published: (2025)
by: Zhang, Mingxu, et al.
Published: (2025)
The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models
by: Cho, Seonglae, et al.
Published: (2026)
by: Cho, Seonglae, et al.
Published: (2026)
EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models
by: Mohammadi, Hadi, et al.
Published: (2025)
by: Mohammadi, Hadi, et al.
Published: (2025)
An Information-Theoretic Framework for Robust Large Language Model Editing
by: Chen, Qizhou, et al.
Published: (2025)
by: Chen, Qizhou, et al.
Published: (2025)
Activation Scaling for Steering and Interpreting Language Models
by: Stoehr, Niklas, et al.
Published: (2024)
by: Stoehr, Niklas, et al.
Published: (2024)
Reasoning in Large Language Models: A Geometric Perspective
by: Cosentino, Romain, et al.
Published: (2024)
by: Cosentino, Romain, et al.
Published: (2024)
Know More, Know Clearer: A Meta-Cognitive Framework for Knowledge Augmentation in Large Language Models
by: Chen, Hao, et al.
Published: (2026)
by: Chen, Hao, et al.
Published: (2026)
ALPS: Attention Localization and Pruning Strategy for Efficient Alignment of Large Language Models
by: Chen, Hao, et al.
Published: (2025)
by: Chen, Hao, et al.
Published: (2025)
Preference Orchestrator: Prompt-Aware Multi-Objective Alignment for Large Language Models
by: Liu, Biao, et al.
Published: (2025)
by: Liu, Biao, et al.
Published: (2025)
BayLing 2: A Multilingual Large Language Model with Efficient Language Alignment
by: Zhang, Shaolei, et al.
Published: (2024)
by: Zhang, Shaolei, et al.
Published: (2024)
ChatUIE: Exploring Chat-based Unified Information Extraction using Large Language Models
by: Xu, Jun, et al.
Published: (2024)
by: Xu, Jun, et al.
Published: (2024)
UniMem: Towards a Unified View of Long-Context Large Language Models
by: Fang, Junjie, et al.
Published: (2024)
by: Fang, Junjie, et al.
Published: (2024)
KELPS: A Framework for Verified Multi-Language Autoformalization via Semantic-Syntactic Alignment
by: Zhang, Jiyao, et al.
Published: (2025)
by: Zhang, Jiyao, et al.
Published: (2025)
THRD: A Training-Free Multi-Turn Defense Framework for Jailbreak Attacks on Large Language Models
by: Ma, Zhiqing, et al.
Published: (2026)
by: Ma, Zhiqing, et al.
Published: (2026)
UniOQA: A Unified Framework for Knowledge Graph Question Answering with Large Language Models
by: Li, Zhuoyang, et al.
Published: (2024)
by: Li, Zhuoyang, et al.
Published: (2024)
A Study of Large Language Models for Patient Information Extraction: Model Architecture, Fine-Tuning Strategy, and Multi-task Instruction Tuning
by: Peng, Cheng, et al.
Published: (2025)
by: Peng, Cheng, et al.
Published: (2025)
To Trust or Not to Trust? Enhancing Large Language Models' Situated Faithfulness to External Contexts
by: Huang, Yukun, et al.
Published: (2024)
by: Huang, Yukun, et al.
Published: (2024)
MALM: A Multi-Information Adapter for Large Language Models to Mitigate Hallucination
by: Jia, Ao, et al.
Published: (2025)
by: Jia, Ao, et al.
Published: (2025)
CrashSage: A Large Language Model-Centered Framework for Contextual and Interpretable Traffic Crash Analysis
by: Zhen, Hao, et al.
Published: (2025)
by: Zhen, Hao, et al.
Published: (2025)
Fundamental Limitations of Alignment in Large Language Models
by: Wolf, Yotam, et al.
Published: (2023)
by: Wolf, Yotam, et al.
Published: (2023)
Benchmarking Distributional Alignment of Large Language Models
by: Meister, Nicole, et al.
Published: (2024)
by: Meister, Nicole, et al.
Published: (2024)
Fake News Detection and Manipulation Reasoning via Large Vision-Language Models
by: Jin, Ruihan, et al.
Published: (2024)
by: Jin, Ruihan, et al.
Published: (2024)
A Multi-Layered Large Language Model Framework for Disease Prediction
by: Mohamed, Malak, et al.
Published: (2025)
by: Mohamed, Malak, et al.
Published: (2025)
Interpretable Differential Diagnosis with Dual-Inference Large Language Models
by: Zhou, Shuang, et al.
Published: (2024)
by: Zhou, Shuang, et al.
Published: (2024)
Similar Items
-
Latent Trajectory Dynamics in Large Language Models: A Manifold Evolution Framework with Empirical Validation
by: Zhang, Yukun, et al.
Published: (2025) -
Hierarchical Alignment: Surgical Fine-Tuning via Functional Layer Specialization in Large Language Models
by: Zhang, Yukun, et al.
Published: (2025) -
Emergent Hierarchical Structure in Large Language Models: An Information-Theoretic Framework for Multi-Scale Representation
by: Zhang, Yukin, et al.
Published: (2025) -
EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models
by: Zhou, Weikang, et al.
Published: (2024) -
ARCANE: A Multi-Agent Framework for Interpretable and Configurable Alignment
by: Masters, Charlie, et al.
Published: (2025)