Measurement of LLM's Philosophies of Human Nature
Fuente:
arXiv
Guardado en:
| Autores principales: | Ni, Minheng, Wu, Ennan, Gong, Zidong, Yang, Zhengyuan, Li, Linjie, Lin, Chung-Ching, Lin, Kevin, Wang, Lijuan, Zuo, Wangmeng |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
por: Ni, Minheng, et al.
Publicado: (2025)
por: Ni, Minheng, et al.
Publicado: (2025)
TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation
por: Ni, Minheng, et al.
Publicado: (2025)
por: Ni, Minheng, et al.
Publicado: (2025)
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
por: Wang, Xiyao, et al.
Publicado: (2024)
por: Wang, Xiyao, et al.
Publicado: (2024)
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2024)
por: Yu, Weihao, et al.
Publicado: (2024)
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
AutoDirector: Online Auto-scheduling Agents for Multi-sensory Composition
por: Ni, Minheng, et al.
Publicado: (2024)
por: Ni, Minheng, et al.
Publicado: (2024)
Idea2Img: Iterative Self-Refinement with GPT-4V(ision) for Automatic Image Design and Generation
por: Yang, Zhengyuan, et al.
Publicado: (2023)
por: Yang, Zhengyuan, et al.
Publicado: (2023)
SlowFast-VGen: Slow-Fast Learning for Action-Driven Long Video Generation
por: Hong, Yining, et al.
Publicado: (2024)
por: Hong, Yining, et al.
Publicado: (2024)
Computer-Use Agents as Judges for Generative User Interface
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
por: Lin, Kevin Qinghong, et al.
Publicado: (2025)
Audio-Aware Large Language Models as Judges for Speaking Styles
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
por: Chiang, Cheng-Han, et al.
Publicado: (2025)
MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2023)
por: Yu, Weihao, et al.
Publicado: (2023)
DisCo: Disentangled Control for Realistic Human Dance Generation
por: Wang, Tan, et al.
Publicado: (2023)
por: Wang, Tan, et al.
Publicado: (2023)
CoEditor++: Instruction-based Visual Editing via Cognitive Reasoning
por: Ni, Minheng, et al.
Publicado: (2026)
por: Ni, Minheng, et al.
Publicado: (2026)
IDOL: Unified Dual-Modal Latent Diffusion for Human-Centric Joint Video-Depth Generation
por: Zhai, Yuanhao, et al.
Publicado: (2024)
por: Zhai, Yuanhao, et al.
Publicado: (2024)
ShowUI: One Vision-Language-Action Model for GUI Visual Agent
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
por: Lin, Kevin Qinghong, et al.
Publicado: (2024)
List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs
por: Yan, An, et al.
Publicado: (2024)
por: Yan, An, et al.
Publicado: (2024)
Diagnostic Benchmark and Iterative Inpainting for Layout-Guided Image Generation
por: Cho, Jaemin, et al.
Publicado: (2023)
por: Cho, Jaemin, et al.
Publicado: (2023)
Responsible Visual Editing
por: Ni, Minheng, et al.
Publicado: (2024)
por: Ni, Minheng, et al.
Publicado: (2024)
Visual-O1: Understanding Ambiguous Instructions via Multi-modal Multi-turn Chain-of-thoughts Reasoning
por: Ni, Minheng, et al.
Publicado: (2024)
por: Ni, Minheng, et al.
Publicado: (2024)
SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement
por: Wang, Xiyao, et al.
Publicado: (2025)
por: Wang, Xiyao, et al.
Publicado: (2025)
Motion Consistency Model: Accelerating Video Diffusion with Disentangled Motion-Appearance Distillation
por: Zhai, Yuanhao, et al.
Publicado: (2024)
por: Zhai, Yuanhao, et al.
Publicado: (2024)
What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding
por: Li, Ming, et al.
Publicado: (2025)
por: Li, Ming, et al.
Publicado: (2025)
Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning
por: Liu, Fuxiao, et al.
Publicado: (2023)
por: Liu, Fuxiao, et al.
Publicado: (2023)
Zero-Shot Audio-Visual Editing via Cross-Modal Delta Denoising
por: Lin, Yan-Bo, et al.
Publicado: (2025)
por: Lin, Yan-Bo, et al.
Publicado: (2025)
GenXD: Generating Any 3D and 4D Scenes
por: Zhao, Yuyang, et al.
Publicado: (2024)
por: Zhao, Yuyang, et al.
Publicado: (2024)
ImageGen-CoT: Enhancing Text-to-Image In-context Learning with Chain-of-Thought Reasoning
por: Liao, Jiaqi, et al.
Publicado: (2025)
por: Liao, Jiaqi, et al.
Publicado: (2025)
LiVOS: Light Video Object Segmentation with Gated Linear Matching
por: Liu, Qin, et al.
Publicado: (2024)
por: Liu, Qin, et al.
Publicado: (2024)
MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos
por: He, Xuehai, et al.
Publicado: (2024)
por: He, Xuehai, et al.
Publicado: (2024)
MIRAGE: Assessing Hallucination in Multimodal Reasoning Chains of MLLM
por: Dong, Bowen, et al.
Publicado: (2025)
por: Dong, Bowen, et al.
Publicado: (2025)
Deciphering the Chaos: Enhancing Jailbreak Attacks via Adversarial Prompt Translation
por: Li, Qizhang, et al.
Publicado: (2024)
por: Li, Qizhang, et al.
Publicado: (2024)
COSMO: COntrastive Streamlined MultimOdal Model with Interleaved Pre-Training
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
por: Wang, Alex Jinpeng, et al.
Publicado: (2024)
EditRoom: LLM-parameterized Graph Diffusion for Composable 3D Room Layout Editing
por: Zheng, Kaizhi, et al.
Publicado: (2024)
por: Zheng, Kaizhi, et al.
Publicado: (2024)
PrinciplismQA: A Philosophy-Grounded Approach to Assessing LLM-Human Clinical Medical Ethics Alignment
por: Hong, Chang, et al.
Publicado: (2025)
por: Hong, Chang, et al.
Publicado: (2025)
HumanLLM: Towards Personalized Understanding and Simulation of Human Nature
por: Lei, Yuxuan, et al.
Publicado: (2026)
por: Lei, Yuxuan, et al.
Publicado: (2026)
StrokeNUWA: Tokenizing Strokes for Vector Graphic Synthesis
por: Tang, Zecheng, et al.
Publicado: (2024)
por: Tang, Zecheng, et al.
Publicado: (2024)
RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning
por: Wang, Zihan, et al.
Publicado: (2025)
por: Wang, Zihan, et al.
Publicado: (2025)
Beyond Words: Advancing Long-Text Image Generation via Multimodal Autoregressive Models
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
por: Wang, Alex Jinpeng, et al.
Publicado: (2025)
LLM as a Complementary Optimizer to Gradient Descent: A Case Study in Prompt Tuning
por: Guo, Zixian, et al.
Publicado: (2024)
por: Guo, Zixian, et al.
Publicado: (2024)
ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs
por: Wang, Xiyao, et al.
Publicado: (2025)
por: Wang, Xiyao, et al.
Publicado: (2025)
Ejemplares similares
-
Point-RFT: Improving Multimodal Reasoning with Visually Grounded Reinforcement Finetuning
por: Ni, Minheng, et al.
Publicado: (2025) -
TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation
por: Ni, Minheng, et al.
Publicado: (2025) -
Scaling Inference-Time Search with Vision Value Model for Improved Visual Comprehension
por: Wang, Xiyao, et al.
Publicado: (2024) -
MM-Vet v2: A Challenging Benchmark to Evaluate Large Multimodal Models for Integrated Capabilities
por: Yu, Weihao, et al.
Publicado: (2024) -
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
por: Chiang, Cheng-Han, et al.
Publicado: (2025)