"See the World, Discover Knowledge": A Chinese Factuality Evaluation for Large Vision Language Models
Fuente:
arXiv
Guardado en:
| Autores principales: | Gu, Jihao, Wang, Yingyao, Bu, Pi, Wang, Chen, Wang, Ziming, Song, Tengtao, Wei, Donglai, Yuan, Jiale, Zhao, Yingxiu, He, Yancheng, Li, Shilong, Liu, Jiaheng, Cao, Meng, Song, Jun, Tan, Yingshui, Li, Xiang, Su, Wenbo, Zheng, Zhicheng, Zhu, Xiaoyong, Zheng, Bo |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
por: He, Yancheng, et al.
Publicado: (2024)
por: He, Yancheng, et al.
Publicado: (2024)
Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
por: Gu, Jihao, et al.
Publicado: (2024)
por: Gu, Jihao, et al.
Publicado: (2024)
GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning
por: Xu, Liangyu, et al.
Publicado: (2025)
por: Xu, Liangyu, et al.
Publicado: (2025)
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
por: Tan, Yingshui, et al.
Publicado: (2024)
por: Tan, Yingshui, et al.
Publicado: (2024)
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
por: Chen, Peng, et al.
Publicado: (2025)
por: Chen, Peng, et al.
Publicado: (2025)
2D-DPO: Scaling Direct Preference Optimization with 2-Dimensional Supervision
por: Li, Shilong, et al.
Publicado: (2024)
por: Li, Shilong, et al.
Publicado: (2024)
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
por: He, Yancheng, et al.
Publicado: (2025)
por: He, Yancheng, et al.
Publicado: (2025)
Video SimpleQA: Towards Factuality Evaluation in Large Video Language Models
por: Cao, Meng, et al.
Publicado: (2025)
por: Cao, Meng, et al.
Publicado: (2025)
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
por: Liu, Jianyu, et al.
Publicado: (2025)
por: Liu, Jianyu, et al.
Publicado: (2025)
AIR: Complex Instruction Generation via Automatic Iterative Refinement
por: Liu, Wei, et al.
Publicado: (2025)
por: Liu, Wei, et al.
Publicado: (2025)
SecAgent: Efficient Mobile GUI Agent with Semantic Context
por: Xie, Yiping, et al.
Publicado: (2026)
por: Xie, Yiping, et al.
Publicado: (2026)
Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training
por: Gu, Jihao, et al.
Publicado: (2025)
por: Gu, Jihao, et al.
Publicado: (2025)
Global Compression Commander: Plug-and-Play Inference Acceleration for High-Resolution Large Vision-Language Models
por: Liu, Xuyang, et al.
Publicado: (2025)
por: Liu, Xuyang, et al.
Publicado: (2025)
GraphReader: Building Graph-based Agent to Enhance Long-Context Abilities of Large Language Models
por: Li, Shilong, et al.
Publicado: (2024)
por: Li, Shilong, et al.
Publicado: (2024)
PSA-VLM: Enhancing Vision-Language Model Safety through Progressive Concept-Bottleneck-Driven Alignment
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
MSR-Align: Policy-Grounded Multimodal Alignment for Safety-Aware Reasoning in Vision-Language Models
por: Xia, Yinan, et al.
Publicado: (2025)
por: Xia, Yinan, et al.
Publicado: (2025)
ProgCo: Program Helps Self-Correction of Large Language Models
por: Song, Xiaoshuai, et al.
Publicado: (2025)
por: Song, Xiaoshuai, et al.
Publicado: (2025)
DeepPHY: Benchmarking Agentic VLMs on Physical Reasoning
por: Xu, Xinrun, et al.
Publicado: (2025)
por: Xu, Xinrun, et al.
Publicado: (2025)
ComparisonQA: Evaluating Factuality Robustness of LLMs Through Knowledge Frequency Control and Uncertainty
por: Zong, Qing, et al.
Publicado: (2024)
por: Zong, Qing, et al.
Publicado: (2024)
Adaptive Segment-level Reward: Bridging the Gap Between Action and Reward Space in Alignment
por: Li, Yanshi, et al.
Publicado: (2024)
por: Li, Yanshi, et al.
Publicado: (2024)
InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning
por: Ai, Qihang, et al.
Publicado: (2025)
por: Ai, Qihang, et al.
Publicado: (2025)
HardMTBench: Stress-Testing Chinese-English Translation on Knowledge-Intensive Domains
por: Li, Zheng, et al.
Publicado: (2026)
por: Li, Zheng, et al.
Publicado: (2026)
HiddenDetect: Detecting Jailbreak Attacks against Large Vision-Language Models via Monitoring Hidden States
por: Jiang, Yilei, et al.
Publicado: (2025)
por: Jiang, Yilei, et al.
Publicado: (2025)
Equilibrate RLHF: Towards Balancing Helpfulness-Safety Trade-off in Large Language Models
por: Tan, Yingshui, et al.
Publicado: (2025)
por: Tan, Yingshui, et al.
Publicado: (2025)
Geoparsing: Diagram Parsing for Plane and Solid Geometry with a Unified Formal Language
por: Wang, Peijie, et al.
Publicado: (2026)
por: Wang, Peijie, et al.
Publicado: (2026)
AndroidLens: Long-latency Evaluation with Nested Sub-targets for Android GUI Agents
por: Cao, Yue, et al.
Publicado: (2025)
por: Cao, Yue, et al.
Publicado: (2025)
ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models
por: Ge, Chunjiang, et al.
Publicado: (2024)
por: Ge, Chunjiang, et al.
Publicado: (2024)
ICPRL: Acquiring Physical Intuition from Interactive Control
por: Xu, Xinrun, et al.
Publicado: (2026)
por: Xu, Xinrun, et al.
Publicado: (2026)
Safety Alignment for Vision Language Models
por: Liu, Zhendong, et al.
Publicado: (2024)
por: Liu, Zhendong, et al.
Publicado: (2024)
QuadSentinel: Sequent Safety for Machine-Checkable Control in Multi-agent Systems
por: Yang, Yiliu, et al.
Publicado: (2025)
por: Yang, Yiliu, et al.
Publicado: (2025)
LongDocURL: a Comprehensive Multimodal Long Document Benchmark Integrating Understanding, Reasoning, and Locating
por: Deng, Chao, et al.
Publicado: (2024)
por: Deng, Chao, et al.
Publicado: (2024)
PretrainRL: Alleviating Factuality Hallucination of Large Language Models at the Beginning
por: Liu, Langming, et al.
Publicado: (2026)
por: Liu, Langming, et al.
Publicado: (2026)
Only Say What You Know: Calibration-Aware Generation for Long-Form Factuality
por: Luo, Wen, et al.
Publicado: (2026)
por: Luo, Wen, et al.
Publicado: (2026)
Face4RAG: Factual Consistency Evaluation for Retrieval Augmented Generation in Chinese
por: Xu, Yunqi, et al.
Publicado: (2024)
por: Xu, Yunqi, et al.
Publicado: (2024)
LLM-Bootstrapped Targeted Finding Guidance for Factual MLLM-based Medical Report Generation
por: Yang, Cunyuan, et al.
Publicado: (2026)
por: Yang, Cunyuan, et al.
Publicado: (2026)
CLR-Fact: Evaluating the Complex Logical Reasoning Capability of Large Language Models over Factual Knowledge
por: Zheng, Tianshi, et al.
Publicado: (2024)
por: Zheng, Tianshi, et al.
Publicado: (2024)
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
por: Bai, Ge, et al.
Publicado: (2024)
por: Bai, Ge, et al.
Publicado: (2024)
MuSC: Improving Complex Instruction Following with Multi-granularity Self-Contrastive Training
por: Huang, Hui, et al.
Publicado: (2025)
por: Huang, Hui, et al.
Publicado: (2025)
Evaluating Reliability Asymmetries in Chinese Factual Search and AI Answers
por: Liu, Geng, et al.
Publicado: (2025)
por: Liu, Geng, et al.
Publicado: (2025)
Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning
por: Li, Zejun, et al.
Publicado: (2025)
por: Li, Zejun, et al.
Publicado: (2025)
Ejemplares similares
-
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
por: He, Yancheng, et al.
Publicado: (2024) -
Token Preference Optimization with Self-Calibrated Visual-Anchored Rewards for Hallucination Mitigation
por: Gu, Jihao, et al.
Publicado: (2024) -
GeoSense: Evaluating Identification and Application of Geometric Principles in Multimodal Reasoning
por: Xu, Liangyu, et al.
Publicado: (2025) -
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
por: Tan, Yingshui, et al.
Publicado: (2024) -
CombatVLA: An Efficient Vision-Language-Action Model for Combat Tasks in 3D Action Role-Playing Games
por: Chen, Peng, et al.
Publicado: (2025)