Benchmarking and Analyzing Generative Data for Visual Recognition
Fuente:
arXiv
Enregistré dans:
| Auteurs principaux: | Li, Bo, Liu, Haotian, Chen, Liangyu, Lee, Yong Jae, Li, Chunyuan, Liu, Ziwei |
|---|---|
| Format: | Preprint |
| Publié: |
2023
|
| Sujets: | |
| Accès en ligne: | |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Improved Baselines with Visual Instruction Tuning
par: Liu, Haotian, et autres
Publié: (2023)
par: Liu, Haotian, et autres
Publié: (2023)
MMInA: Benchmarking Multihop Multimodal Internet Agents
par: Tian, Shulin, et autres
Publié: (2024)
par: Tian, Shulin, et autres
Publié: (2024)
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024)
par: Li, Bo, et autres
Publié: (2024)
CollagePrompt: A Benchmark for Budget-Friendly Visual Recognition with GPT-4V
par: Xu, Siyu, et autres
Publié: (2024)
par: Xu, Siyu, et autres
Publié: (2024)
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
par: Xue, Haotian, et autres
Publié: (2025)
par: Xue, Haotian, et autres
Publié: (2025)
Towards Autonomous UAV Visual Object Search in City Space: Benchmark and Agentic Methodology
par: Ji, Yatai, et autres
Publié: (2025)
par: Ji, Yatai, et autres
Publié: (2025)
How Multimodal LLMs Solve Image Tasks: A Lens on Visual Grounding, Task Reasoning, and Answer Decoding
par: Yu, Zhuoran, et autres
Publié: (2025)
par: Yu, Zhuoran, et autres
Publié: (2025)
USAD: End-to-End Human Activity Recognition via Diffusion Model with Spatiotemporal Attention
par: Xiao, Hang, et autres
Publié: (2025)
par: Xiao, Hang, et autres
Publié: (2025)
SOK-Bench: A Situated Video Reasoning Benchmark with Aligned Open-World Knowledge
par: Wang, Andong, et autres
Publié: (2024)
par: Wang, Andong, et autres
Publié: (2024)
VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping
par: Dong, Haotian, et autres
Publié: (2025)
par: Dong, Haotian, et autres
Publié: (2025)
CMD-HAR: Cross-Modal Disentanglement for Wearable Human Activity Recognition
par: Yu, Ying, et autres
Publié: (2025)
par: Yu, Ying, et autres
Publié: (2025)
Decomposing and Fusing Intra- and Inter-Sensor Spatio-Temporal Signal for Multi-Sensor Wearable Human Activity Recognition
par: Xie, Haoyu, et autres
Publié: (2025)
par: Xie, Haoyu, et autres
Publié: (2025)
CHARTOM: A Visual Theory-of-Mind Benchmark for LLMs on Misleading Charts
par: Bharti, Shubham, et autres
Publié: (2024)
par: Bharti, Shubham, et autres
Publié: (2024)
Diversify, Don't Fine-Tune: Scaling Up Visual Recognition Training with Synthetic Images
par: Yu, Zhuoran, et autres
Publié: (2023)
par: Yu, Zhuoran, et autres
Publié: (2023)
Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition
par: Choi, Jae Young, et autres
Publié: (2026)
par: Choi, Jae Young, et autres
Publié: (2026)
Lens Privacy Sealing: A New Benchmark and Method for Physical Privacy-Preserving Action Recognition
par: Liu, Mengyuan, et autres
Publié: (2026)
par: Liu, Mengyuan, et autres
Publié: (2026)
Visual Text Compression as Measure Transport
par: Tang, Lv, et autres
Publié: (2026)
par: Tang, Lv, et autres
Publié: (2026)
VisualNeedle: Benchmarking Active Visual Search in Information-Dense Scenes
par: Chen, Jingru, et autres
Publié: (2026)
par: Chen, Jingru, et autres
Publié: (2026)
Towards Fine-Grained Recognition with Large Visual Language Models: Benchmark and Optimization Strategies
par: Pang, Cong, et autres
Publié: (2025)
par: Pang, Cong, et autres
Publié: (2025)
Seeing the Image: Prioritizing Visual Correlation by Contrastive Alignment
par: Xiao, Xin, et autres
Publié: (2024)
par: Xiao, Xin, et autres
Publié: (2024)
Simulating the Visual World with Artificial Intelligence: A Roadmap
par: Yue, Jingtong, et autres
Publié: (2025)
par: Yue, Jingtong, et autres
Publié: (2025)
Evaluation Agent: Efficient and Promptable Evaluation Framework for Visual Generative Models
par: Zhang, Fan, et autres
Publié: (2024)
par: Zhang, Fan, et autres
Publié: (2024)
CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments
par: Xu, Haotian, et autres
Publié: (2026)
par: Xu, Haotian, et autres
Publié: (2026)
ViP-LLaVA: Making Large Multimodal Models Understand Arbitrary Visual Prompts
par: Cai, Mu, et autres
Publié: (2023)
par: Cai, Mu, et autres
Publié: (2023)
YoChameleon: Personalized Vision and Language Generation
par: Nguyen, Thao, et autres
Publié: (2025)
par: Nguyen, Thao, et autres
Publié: (2025)
Measuring the Unspoken: A Disentanglement Model and Benchmark for Psychological Analysis in the Wild
par: Feng, Yigui, et autres
Publié: (2025)
par: Feng, Yigui, et autres
Publié: (2025)
RGB-Event based Pedestrian Attribute Recognition: A Benchmark Dataset and An Asymmetric RWKV Fusion Framework
par: Wang, Xiao, et autres
Publié: (2025)
par: Wang, Xiao, et autres
Publié: (2025)
Distilling Generative-Discriminative Representations for Very Low-Resolution Face Recognition
par: Zhang, Junzheng, et autres
Publié: (2024)
par: Zhang, Junzheng, et autres
Publié: (2024)
Micro-expression Recognition Based on Dual-branch Feature Extraction and Fusion
par: Zhang, Mingjie, et autres
Publié: (2026)
par: Zhang, Mingjie, et autres
Publié: (2026)
A Benchmark for Incremental Micro-expression Recognition
par: Lai, Zhengqin, et autres
Publié: (2025)
par: Lai, Zhengqin, et autres
Publié: (2025)
Aligning Neuronal Coding of Dynamic Visual Scenes with Foundation Vision Models
par: Wu, Rining, et autres
Publié: (2024)
par: Wu, Rining, et autres
Publié: (2024)
See and Fix the Flaws: Enabling VLMs and Diffusion Models to Comprehend Visual Artifacts via Agentic Data Synthesis
par: Park, Jaehyun, et autres
Publié: (2026)
par: Park, Jaehyun, et autres
Publié: (2026)
ChartM$^3$: Benchmarking Chart Editing with Multimodal Instructions
par: Yang, Donglu, et autres
Publié: (2025)
par: Yang, Donglu, et autres
Publié: (2025)
Cut2Next: Generating Next Shot via In-Context Tuning
par: He, Jingwen, et autres
Publié: (2025)
par: He, Jingwen, et autres
Publié: (2025)
4D Panoptic Scene Graph Generation
par: Yang, Jingkang, et autres
Publié: (2024)
par: Yang, Jingkang, et autres
Publié: (2024)
Pair then Relation: Pair-Net for Panoptic Scene Graph Generation
par: Wang, Jinghao, et autres
Publié: (2023)
par: Wang, Jinghao, et autres
Publié: (2023)
Interactive Visual Assessment for Text-to-Image Generation Models
par: Mi, Xiaoyue, et autres
Publié: (2024)
par: Mi, Xiaoyue, et autres
Publié: (2024)
MSC-Bench: Benchmarking and Analyzing Multi-Sensor Corruption for Driving Perception
par: Hao, Xiaoshuai, et autres
Publié: (2025)
par: Hao, Xiaoshuai, et autres
Publié: (2025)
Deep Homography Estimation for Visual Place Recognition
par: Lu, Feng, et autres
Publié: (2024)
par: Lu, Feng, et autres
Publié: (2024)
PTQ4ARVG: Post-Training Quantization for AutoRegressive Visual Generation Models
par: Liu, Xuewen, et autres
Publié: (2026)
par: Liu, Xuewen, et autres
Publié: (2026)
Documents similaires
-
Improved Baselines with Visual Instruction Tuning
par: Liu, Haotian, et autres
Publié: (2023) -
MMInA: Benchmarking Multihop Multimodal Internet Agents
par: Tian, Shulin, et autres
Publié: (2024) -
LLaVA-OneVision: Easy Visual Task Transfer
par: Li, Bo, et autres
Publié: (2024) -
CollagePrompt: A Benchmark for Budget-Friendly Visual Recognition with GPT-4V
par: Xu, Siyu, et autres
Publié: (2024) -
Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding
par: Xue, Haotian, et autres
Publié: (2025)