Piculet: Specialized Models-Guided Hallucination Decrease for MultiModal Large Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Wang, Kohou, Liu, Xiang, Liu, Zhaoxiang, Wang, Kai, Lian, Shiguo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
A Large Vision-Language Model based Environment Perception System for Visually Impaired People
por: Chen, Zezhou, et al.
Publicado: (2025)
por: Chen, Zezhou, et al.
Publicado: (2025)
SLearnLLM: A Self-Learning Framework for Efficient Domain-Specific Adaptation of Large Language Models
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
A Multimodal Benchmark Dataset and Model for Crop Disease Diagnosis
por: Liu, Xiang, et al.
Publicado: (2025)
por: Liu, Xiang, et al.
Publicado: (2025)
Hierarchical Deep Fusion Framework for Multi-dimensional Facial Forgery Detection -- The 2024 Global Deepfake Image Detection Challenge
por: Wang, Kohou, et al.
Publicado: (2025)
por: Wang, Kohou, et al.
Publicado: (2025)
iLearnRobot: An Interactive Learning-Based Multi-Modal Robot with Continuous Improvement
por: Wang, Kohou, et al.
Publicado: (2025)
por: Wang, Kohou, et al.
Publicado: (2025)
GlitchMiner: Mining Glitch Tokens in Large Language Models via Gradient-based Discrete Optimization
por: Wu, Zihui, et al.
Publicado: (2024)
por: Wu, Zihui, et al.
Publicado: (2024)
CHiSafetyBench: A Chinese Hierarchical Safety Benchmark for Large Language Models
por: Zhang, Wenjing, et al.
Publicado: (2024)
por: Zhang, Wenjing, et al.
Publicado: (2024)
What is the best model? Application-driven Evaluation for Large Language Models
por: Lian, Shiguo, et al.
Publicado: (2024)
por: Lian, Shiguo, et al.
Publicado: (2024)
Mixture of Heterogeneous Grouped Experts for Language Modeling
por: Ma, Zhicheng, et al.
Publicado: (2026)
por: Ma, Zhicheng, et al.
Publicado: (2026)
MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models
por: Zhang, Wei, et al.
Publicado: (2025)
por: Zhang, Wei, et al.
Publicado: (2025)
Methodology of Adapting Large English Language Models for Specific Cultural Contexts
por: Zhang, Wenjing, et al.
Publicado: (2024)
por: Zhang, Wenjing, et al.
Publicado: (2024)
Patch-wise Auto-Encoder for Visual Anomaly Detection
por: Cui, Yajie, et al.
Publicado: (2023)
por: Cui, Yajie, et al.
Publicado: (2023)
Visual-Oriented Fine-Grained Knowledge Editing for MultiModal Large Language Models
por: Zeng, Zhen, et al.
Publicado: (2024)
por: Zeng, Zhen, et al.
Publicado: (2024)
Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character
por: Ma, Siyuan, et al.
Publicado: (2024)
por: Ma, Siyuan, et al.
Publicado: (2024)
From Seconds to Hours: Reviewing MultiModal Large Language Models on Comprehensive Long Video Understanding
por: Zou, Heqing, et al.
Publicado: (2024)
por: Zou, Heqing, et al.
Publicado: (2024)
DAST: Difficulty-Adaptive Slow-Thinking for Large Reasoning Models
por: Shen, Yi, et al.
Publicado: (2025)
por: Shen, Yi, et al.
Publicado: (2025)
JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks
por: Luo, Weidi, et al.
Publicado: (2024)
por: Luo, Weidi, et al.
Publicado: (2024)
MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings
por: Li, Zijie, et al.
Publicado: (2026)
por: Li, Zijie, et al.
Publicado: (2026)
A Systematic Security Evaluation of OpenClaw and Its Variants
por: Wang, Yuhang, et al.
Publicado: (2026)
por: Wang, Yuhang, et al.
Publicado: (2026)
MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models
por: Yan, Bei, et al.
Publicado: (2024)
por: Yan, Bei, et al.
Publicado: (2024)
Fuzzy Reasoning Chain (FRC): An Innovative Reasoning Framework from Fuzziness to Clarity
por: Chen, Ping, et al.
Publicado: (2025)
por: Chen, Ping, et al.
Publicado: (2025)
Early Joint Learning of Emotion Information Makes MultiModal Model Understand You Better
por: Ge, Mengying, et al.
Publicado: (2024)
por: Ge, Mengying, et al.
Publicado: (2024)
Safety Evaluation of DeepSeek Models in Chinese Contexts
por: Zhang, Wenjing, et al.
Publicado: (2025)
por: Zhang, Wenjing, et al.
Publicado: (2025)
MITS: A Large-Scale Multimodal Benchmark Dataset for Intelligent Traffic Surveillance
por: Zhao, Kaikai, et al.
Publicado: (2025)
por: Zhao, Kaikai, et al.
Publicado: (2025)
Multi-Modal Fact-Verification Framework for Reducing Hallucinations in Large Language Models
por: Patel, Piyushkumar
Publicado: (2025)
por: Patel, Piyushkumar
Publicado: (2025)
On the Feasibility of Using MultiModal LLMs to Execute AR Social Engineering Attacks
por: Bi, Ting, et al.
Publicado: (2025)
por: Bi, Ting, et al.
Publicado: (2025)
Distributed Specialization: Rare-Token Neurons in Large Language Models
por: Liu, Jing, et al.
Publicado: (2025)
por: Liu, Jing, et al.
Publicado: (2025)
LeMiCa: Lexicographic Minimax Path Caching for Efficient Diffusion-Based Video Generation
por: Gao, Huanlin, et al.
Publicado: (2025)
por: Gao, Huanlin, et al.
Publicado: (2025)
MAD: Modality-Adaptive Decoding for Mitigating Cross-Modal Hallucinations in Multimodal Large Language Models
por: Chung, Sangyun, et al.
Publicado: (2026)
por: Chung, Sangyun, et al.
Publicado: (2026)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
por: Liu, Fuxiao, et al.
Publicado: (2023)
por: Liu, Fuxiao, et al.
Publicado: (2023)
A Novel Multi-Agent Architecture to Reduce Hallucinations of Large Language Models in Multi-Step Structural Modeling
por: Geng, Ziheng, et al.
Publicado: (2026)
por: Geng, Ziheng, et al.
Publicado: (2026)
M2R2: MultiModal Robotic Representation for Temporal Action Segmentation
por: Sliwowski, Daniel, et al.
Publicado: (2025)
por: Sliwowski, Daniel, et al.
Publicado: (2025)
Quantifying the Capability Boundary of DeepSeek Models: An Application-Driven Performance Analysis
por: Zhao, Kaikai, et al.
Publicado: (2025)
por: Zhao, Kaikai, et al.
Publicado: (2025)
HEAL: Hindsight Entropy-Assisted Learning for Reasoning Distillation
por: Zhang, Wenjing, et al.
Publicado: (2026)
por: Zhang, Wenjing, et al.
Publicado: (2026)
NoiseBoost: Alleviating Hallucination with Noise Perturbation for Multimodal Large Language Models
por: Wu, Kai, et al.
Publicado: (2024)
por: Wu, Kai, et al.
Publicado: (2024)
Visual Hallucinations of Multi-modal Large Language Models
por: Huang, Wen, et al.
Publicado: (2024)
por: Huang, Wen, et al.
Publicado: (2024)
From Assistant to Double Agent: Formalizing and Benchmarking Attacks on OpenClaw for Personalized Local AI Agent
por: Wang, Yuhang, et al.
Publicado: (2026)
por: Wang, Yuhang, et al.
Publicado: (2026)
MultiModal-Learning for Predicting Molecular Properties: A Framework Based on Image and Graph Structures
por: Wang, Zhuoyuan, et al.
Publicado: (2023)
por: Wang, Zhuoyuan, et al.
Publicado: (2023)
Survey of Specialized Large Language Model
por: Yang, Chenghan, et al.
Publicado: (2025)
por: Yang, Chenghan, et al.
Publicado: (2025)
Emergent Specialization: Rare Token Neurons in Language Models
por: Liu, Jing, et al.
Publicado: (2025)
por: Liu, Jing, et al.
Publicado: (2025)
Ejemplares similares
-
A Large Vision-Language Model based Environment Perception System for Visually Impaired People
por: Chen, Zezhou, et al.
Publicado: (2025) -
SLearnLLM: A Self-Learning Framework for Efficient Domain-Specific Adaptation of Large Language Models
por: Liu, Xiang, et al.
Publicado: (2025) -
A Multimodal Benchmark Dataset and Model for Crop Disease Diagnosis
por: Liu, Xiang, et al.
Publicado: (2025) -
Hierarchical Deep Fusion Framework for Multi-dimensional Facial Forgery Detection -- The 2024 Global Deepfake Image Detection Challenge
por: Wang, Kohou, et al.
Publicado: (2025) -
iLearnRobot: An Interactive Learning-Based Multi-Modal Robot with Continuous Improvement
por: Wang, Kohou, et al.
Publicado: (2025)