Enregistré dans:
| Auteurs principaux: | Huang, Zihan, Wu, Tao, Lin, Wang, Zhang, Shengyu, Chen, Jingyuan, Wu, Fei |
|---|---|
| Format: | Preprint |
| Publié: |
2024
|
| Sujets: | |
| Accès en ligne: | https://arxiv.org/abs/2409.09039 |
| Tags: |
Ajouter un tag
Pas de tags, Soyez le premier à ajouter un tag!
|
Documents similaires
Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation
par: Xu, Zhiyang, et autres
Publié: (2025)
par: Xu, Zhiyang, et autres
Publié: (2025)
WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark
par: Lin, Wang, et autres
Publié: (2026)
par: Lin, Wang, et autres
Publié: (2026)
Geometry OR Tracker: Universal Geometric Operating Room Tracking
par: Shao, Yihua, et autres
Publié: (2026)
par: Shao, Yihua, et autres
Publié: (2026)
GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
par: Guo, Shasha, et autres
Publié: (2025)
par: Guo, Shasha, et autres
Publié: (2025)
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
par: Lv, Zheqi, et autres
Publié: (2025)
par: Lv, Zheqi, et autres
Publié: (2025)
DatasetAgent: A Novel Multi-Agent System for Auto-Constructing Datasets from Real-World Images
par: Sun, Haoran, et autres
Publié: (2025)
par: Sun, Haoran, et autres
Publié: (2025)
OmniScience: A Large-scale Multi-modal Dataset for Scientific Image Understanding
par: Tao, Haoyi, et autres
Publié: (2026)
par: Tao, Haoyi, et autres
Publié: (2026)
Enhancing Multimodal Understanding with CLIP-Based Image-to-Text Transformation
par: Che, Chang, et autres
Publié: (2024)
par: Che, Chang, et autres
Publié: (2024)
Revisiting Visual Understanding in Multimodal Reasoning through a Lens of Image Perturbation
par: Li, Yuting, et autres
Publié: (2025)
par: Li, Yuting, et autres
Publié: (2025)
GeoBiked: A Dataset with Geometric Features and Automated Labeling Techniques to Enable Deep Generative Models in Engineering Design
par: Mueller, Phillip, et autres
Publié: (2024)
par: Mueller, Phillip, et autres
Publié: (2024)
Auto-nnU-Net: Towards Automated Medical Image Segmentation
par: Becktepe, Jannis, et autres
Publié: (2025)
par: Becktepe, Jannis, et autres
Publié: (2025)
AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use
par: Yang, Yaotian, et autres
Publié: (2025)
par: Yang, Yaotian, et autres
Publié: (2025)
Nested AutoRegressive Models
par: Wu, Hongyu, et autres
Publié: (2025)
par: Wu, Hongyu, et autres
Publié: (2025)
On Synthetic Texture Datasets: Challenges, Creation, and Curation
par: Hoak, Blaine, et autres
Publié: (2024)
par: Hoak, Blaine, et autres
Publié: (2024)
Large-Scale 3D Medical Image Pre-training with Geometric Context Priors
par: Wu, Linshan, et autres
Publié: (2024)
par: Wu, Linshan, et autres
Publié: (2024)
GeoDM: Geometry-aware Distribution Matching for Dataset Distillation
par: Li, Xuhui, et autres
Publié: (2025)
par: Li, Xuhui, et autres
Publié: (2025)
Why Vision Language Models Struggle with Visual Arithmetic? Towards Enhanced Chart and Geometry Understanding
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
par: Huang, Kung-Hsiang, et autres
Publié: (2025)
ID-Aligner: Enhancing Identity-Preserving Text-to-Image Generation with Reward Feedback Learning
par: Chen, Weifeng, et autres
Publié: (2024)
par: Chen, Weifeng, et autres
Publié: (2024)
A Dataset Generation Scheme Based on Video2EEG-SPGN-Diffusion for SEED-VD
par: Guo, Yunfei, et autres
Publié: (2025)
par: Guo, Yunfei, et autres
Publié: (2025)
Geometry-Aware State Space Model: A New Paradigm for Whole-Slide Image Representation
par: Chai, Enhui, et autres
Publié: (2026)
par: Chai, Enhui, et autres
Publié: (2026)
Bosch Street Dataset: A Multi-Modal Dataset with Imaging Radar for Automated Driving
par: Armanious, Karim, et autres
Publié: (2024)
par: Armanious, Karim, et autres
Publié: (2024)
Understanding Semantic Perturbations on In-Processing Generative Image Watermarks
par: Nakra, Anirudh, et autres
Publié: (2026)
par: Nakra, Anirudh, et autres
Publié: (2026)
ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation
par: Zhang, Mengchen, et autres
Publié: (2025)
par: Zhang, Mengchen, et autres
Publié: (2025)
GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models
par: Ye, Zhankai, et autres
Publié: (2026)
par: Ye, Zhankai, et autres
Publié: (2026)
AutoLTS: Automating Cycling Stress Assessment via Contrastive Learning and Spatial Post-processing
par: Lin, Bo, et autres
Publié: (2023)
par: Lin, Bo, et autres
Publié: (2023)
High-Quality 3D Creation from A Single Image Using Subject-Specific Knowledge Prior
par: Huang, Nan, et autres
Publié: (2023)
par: Huang, Nan, et autres
Publié: (2023)
Synthesizing Multimodal Geometry Datasets from Scratch and Enabling Visual Alignment via Plotting Code
par: Lin, Haobo, et autres
Publié: (2026)
par: Lin, Haobo, et autres
Publié: (2026)
Human-Guided Image Generation for Expanding Small-Scale Training Image Datasets
par: Chen, Changjian, et autres
Publié: (2024)
par: Chen, Changjian, et autres
Publié: (2024)
Large Language Models Can Understanding Depth from Monocular Images
par: Xia, Zhongyi, et autres
Publié: (2024)
par: Xia, Zhongyi, et autres
Publié: (2024)
SLIC: Secure Learned Image Codec through Compressed Domain Watermarking to Defend Image Manipulation
par: Huang, Chen-Hsiu, et autres
Publié: (2024)
par: Huang, Chen-Hsiu, et autres
Publié: (2024)
Free Lunch for Unified Multimodal Models: Enhancing Generation via Reflective Rectification with Inherent Understanding
par: Jiang, Yibo, et autres
Publié: (2026)
par: Jiang, Yibo, et autres
Publié: (2026)
Enhancing Adverse Drug Event Detection with Multimodal Dataset: Corpus Creation and Model Development
par: Sahoo, Pranab, et autres
Publié: (2024)
par: Sahoo, Pranab, et autres
Publié: (2024)
InverseMeetInsert: Robust Real Image Editing via Geometric Accumulation Inversion in Guided Diffusion Models
par: Zheng, Yan, et autres
Publié: (2024)
par: Zheng, Yan, et autres
Publié: (2024)
Rectified Point Flow: Generic Point Cloud Pose Estimation
par: Sun, Tao, et autres
Publié: (2025)
par: Sun, Tao, et autres
Publié: (2025)
VCD: A Dataset for Visual Commonsense Discovery in Images
par: Shen, Xiangqing, et autres
Publié: (2024)
par: Shen, Xiangqing, et autres
Publié: (2024)
L-AutoDA: Leveraging Large Language Models for Automated Decision-based Adversarial Attacks
par: Guo, Ping, et autres
Publié: (2024)
par: Guo, Ping, et autres
Publié: (2024)
Generating Attribution Reports for Manipulated Facial Images: A Dataset and Baseline
par: Lian, Jingchun, et autres
Publié: (2024)
par: Lian, Jingchun, et autres
Publié: (2024)
ArtAug: Enhancing Text-to-Image Generation through Synthesis-Understanding Interaction
par: Duan, Zhongjie, et autres
Publié: (2024)
par: Duan, Zhongjie, et autres
Publié: (2024)
Multiscale Adaptive Conflict-Balancing Model For Multimedia Deepfake Detection
par: Xiong, Zihan, et autres
Publié: (2025)
par: Xiong, Zihan, et autres
Publié: (2025)
STAR: STacked AutoRegressive Scheme for Unified Multimodal Learning
par: Qin, Jie, et autres
Publié: (2025)
par: Qin, Jie, et autres
Publié: (2025)
Documents similaires
-
Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation
par: Xu, Zhiyang, et autres
Publié: (2025) -
WorldEdit: Towards Open-World Image Editing with a Knowledge-Informed Benchmark
par: Lin, Wang, et autres
Publié: (2026) -
Geometry OR Tracker: Universal Geometric Operating Room Tracking
par: Shao, Yihua, et autres
Publié: (2026) -
GeoVLMath: Enhancing Geometry Reasoning in Vision-Language Models via Cross-Modal Reward for Auxiliary Line Creation
par: Guo, Shasha, et autres
Publié: (2025) -
Multimodal LLM-Guided Semantic Correction in Text-to-Image Diffusion
par: Lv, Zheqi, et autres
Publié: (2025)