Cluster-norm for Unsupervised Probing of Knowledge
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Laurito, Walter, Maiya, Sharan, Dhimoïla, Grégoire, Owen, Yeung, Hänni, Kaarel |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Liars' Bench: Evaluating Lie Detectors for Language Models
par: Kretschmar, Kieron, et autres
Publié: (2025)
par: Kretschmar, Kieron, et autres
Publié: (2025)
Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI
par: Maiya, Sharan, et autres
Publié: (2025)
par: Maiya, Sharan, et autres
Publié: (2025)
OnPrem.LLM: A Privacy-Conscious Document Intelligence Toolkit
par: Maiya, Arun S.
Publié: (2025)
par: Maiya, Arun S.
Publié: (2025)
Improving Preference Extraction In LLMs By Identifying Latent Knowledge Through Classifying Probes
par: Maiya, Sharan, et autres
Publié: (2025)
par: Maiya, Sharan, et autres
Publié: (2025)
Mathematical Models of Computation in Superposition
par: Hänni, Kaarel, et autres
Publié: (2024)
par: Hänni, Kaarel, et autres
Publié: (2024)
Ulterior Motives: Detecting Misaligned Reasoning in Continuous Thought Models
par: Ramjee, Sharan
Publié: (2026)
par: Ramjee, Sharan
Publié: (2026)
Compute Optimal Scaling of Skills: Knowledge vs Reasoning
par: Roberts, Nicholas, et autres
Publié: (2025)
par: Roberts, Nicholas, et autres
Publié: (2025)
AI-AI Bias: large language models favor communications generated by large language models
par: Laurito, Walter, et autres
Publié: (2024)
par: Laurito, Walter, et autres
Publié: (2024)
Will AI Tell Lies to Save Sick Children? Litmus-Testing AI Values Prioritization with AIRiskDilemmas
par: Chiu, Yu Ying, et autres
Publié: (2025)
par: Chiu, Yu Ying, et autres
Publié: (2025)
Reasoning-Based Refinement of Unsupervised Text Clusters with LLMs
par: Islam, Tunazzina
Publié: (2026)
par: Islam, Tunazzina
Publié: (2026)
KGLens: Towards Efficient and Effective Knowledge Probing of Large Language Models with Knowledge Graphs
par: Zheng, Shangshang, et autres
Publié: (2023)
par: Zheng, Shangshang, et autres
Publié: (2023)
Transformers Learn to Achieve Second-Order Convergence Rates for In-Context Linear Regression
par: Fu, Deqing, et autres
Publié: (2023)
par: Fu, Deqing, et autres
Publié: (2023)
Convergent Evolution: How Different Language Models Learn Similar Number Representations
par: Fu, Deqing, et autres
Publié: (2026)
par: Fu, Deqing, et autres
Publié: (2026)
Knowledge Graph Reasoning with Self-supervised Reinforcement Learning
par: Ma, Ying, et autres
Publié: (2024)
par: Ma, Ying, et autres
Publié: (2024)
Transformers Learn Low Sensitivity Functions: Investigations and Implications
par: Vasudeva, Bhavya, et autres
Publié: (2024)
par: Vasudeva, Bhavya, et autres
Publié: (2024)
Ensemble Distillation for Unsupervised Constituency Parsing
par: Shayegh, Behzad, et autres
Publié: (2023)
par: Shayegh, Behzad, et autres
Publié: (2023)
BiomedSQL: Text-to-SQL for Scientific Reasoning on Biomedical Knowledge Bases
par: Koretsky, Mathew J., et autres
Publié: (2025)
par: Koretsky, Mathew J., et autres
Publié: (2025)
Latent Concept Disentanglement in Transformer-based Language Models
par: Hong, Guan Zhe, et autres
Publié: (2025)
par: Hong, Guan Zhe, et autres
Publié: (2025)
Code Comprehension then Auditing for Unsupervised LLM Evaluation
par: Patel, Bhrij, et autres
Publié: (2024)
par: Patel, Bhrij, et autres
Publié: (2024)
Probe Pruning: Accelerating LLMs through Dynamic Pruning via Model-Probing
par: Le, Qi, et autres
Publié: (2025)
par: Le, Qi, et autres
Publié: (2025)
ARGUS: Adaptive Rotation-Invariant Geometric Unsupervised System
par: Sharma, Anantha
Publié: (2026)
par: Sharma, Anantha
Publié: (2026)
Decomposing Representation Space into Interpretable Subspaces with Unsupervised Learning
par: Huang, Xinting, et autres
Publié: (2025)
par: Huang, Xinting, et autres
Publié: (2025)
Examining Gender and Power on Wikipedia Through Face and Politeness
par: Soubki, Adil, et autres
Publié: (2024)
par: Soubki, Adil, et autres
Publié: (2024)
Martingale Score: An Unsupervised Metric for Bayesian Rationality in LLM Reasoning
par: He, Zhonghao, et autres
Publié: (2025)
par: He, Zhonghao, et autres
Publié: (2025)
Re-evaluating the Need for Multimodal Signals in Unsupervised Grammar Induction
par: Li, Boyi, et autres
Publié: (2022)
par: Li, Boyi, et autres
Publié: (2022)
How Reliable are Causal Probing Interventions?
par: Canby, Marc, et autres
Publié: (2024)
par: Canby, Marc, et autres
Publié: (2024)
The Information Geometry of Softmax: Probing and Steering
par: Park, Kiho, et autres
Publié: (2026)
par: Park, Kiho, et autres
Publié: (2026)
Building Production-Ready Probes For Gemini
par: Kramár, János, et autres
Publié: (2026)
par: Kramár, János, et autres
Publié: (2026)
Tree-Averaging Algorithms for Ensemble-Based Unsupervised Discontinuous Constituency Parsing
par: Shayegh, Behzad, et autres
Publié: (2024)
par: Shayegh, Behzad, et autres
Publié: (2024)
Fine-Tuning LLMs for Report Summarization: Analysis on Supervised and Unsupervised Data
par: Rallapalli, Swati, et autres
Publié: (2025)
par: Rallapalli, Swati, et autres
Publié: (2025)
DivLogicEval: A Framework for Benchmarking Logical Reasoning Evaluation in Large Language Models
par: Chung, Tsz Ting, et autres
Publié: (2025)
par: Chung, Tsz Ting, et autres
Publié: (2025)
Error Diversity Matters: An Error-Resistant Ensemble Method for Unsupervised Dependency Parsing
par: Shayegh, Behzad, et autres
Publié: (2024)
par: Shayegh, Behzad, et autres
Publié: (2024)
Fantastic Reasoning Behaviors and Where to Find Them: Unsupervised Discovery of the Reasoning Process
par: Zhang, Zhenyu, et autres
Publié: (2025)
par: Zhang, Zhenyu, et autres
Publié: (2025)
Genius: A Generalizable and Purely Unsupervised Self-Training Framework For Advanced Reasoning
par: Xu, Fangzhi, et autres
Publié: (2025)
par: Xu, Fangzhi, et autres
Publié: (2025)
Generative AI for FFRDCs
par: Maiya, Arun S.
Publié: (2025)
par: Maiya, Arun S.
Publié: (2025)
Knowledge Base Construction for Knowledge-Augmented Text-to-SQL
par: Baek, Jinheon, et autres
Publié: (2025)
par: Baek, Jinheon, et autres
Publié: (2025)
Enhancing In-context Learning via Linear Probe Calibration
par: Abbas, Momin, et autres
Publié: (2024)
par: Abbas, Momin, et autres
Publié: (2024)
Probing Semantic Routing in Large Mixture-of-Expert Models
par: Olson, Matthew Lyle, et autres
Publié: (2025)
par: Olson, Matthew Lyle, et autres
Publié: (2025)
Forgetting Transformer: Softmax Attention with a Forget Gate
par: Lin, Zhixuan, et autres
Publié: (2025)
par: Lin, Zhixuan, et autres
Publié: (2025)
Large Language Models for Medical Forecasting -- Foresight 2
par: Kraljevic, Zeljko, et autres
Publié: (2024)
par: Kraljevic, Zeljko, et autres
Publié: (2024)
Documents similaires
-
Liars' Bench: Evaluating Lie Detectors for Language Models
par: Kretschmar, Kieron, et autres
Publié: (2025) -
Open Character Training: Shaping the Persona of AI Assistants through Constitutional AI
par: Maiya, Sharan, et autres
Publié: (2025) -
OnPrem.LLM: A Privacy-Conscious Document Intelligence Toolkit
par: Maiya, Arun S.
Publié: (2025) -
Improving Preference Extraction In LLMs By Identifying Latent Knowledge Through Classifying Probes
par: Maiya, Sharan, et autres
Publié: (2025) -
Mathematical Models of Computation in Superposition
par: Hänni, Kaarel, et autres
Publié: (2024)