Guardado en:
| Autores principales: | Lei, Chenyang, Chen, Liyi, Cen, Jun, Chen, Xiao, Lei, Zhen, Heide, Felix, Liu, Ziwei, Chen, Qifeng, Zhang, Zhaoxiang |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | https://arxiv.org/abs/2409.08083 |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality
por: Lei, Chenyang, et al.
Publicado: (2024)
por: Lei, Chenyang, et al.
Publicado: (2024)
Robust Depth Enhancement via Polarization Prompt Fusion Tuning
por: Ikemura, Kei, et al.
Publicado: (2024)
por: Ikemura, Kei, et al.
Publicado: (2024)
General Geometry-aware Weakly Supervised 3D Object Detection
por: Zhang, Guowen, et al.
Publicado: (2024)
por: Zhang, Guowen, et al.
Publicado: (2024)
FIRM: Flexible Interactive Reflection reMoval
por: Chen, Xiao, et al.
Publicado: (2024)
por: Chen, Xiao, et al.
Publicado: (2024)
Automatic Controllable Colorization via Imagination
por: Cong, Xiaoyan, et al.
Publicado: (2024)
por: Cong, Xiaoyan, et al.
Publicado: (2024)
Adaptive Domain Learning for Cross-domain Image Denoising
por: Qian, Zian, et al.
Publicado: (2024)
por: Qian, Zian, et al.
Publicado: (2024)
BEVDilation: LiDAR-Centric Multi-Modal Fusion for 3D Object Detection
por: Zhang, Guowen, et al.
Publicado: (2025)
por: Zhang, Guowen, et al.
Publicado: (2025)
Instruction-based Image Editing with Planning, Reasoning, and Generation
por: Ji, Liya, et al.
Publicado: (2026)
por: Ji, Liya, et al.
Publicado: (2026)
FreeTuner: Any Subject in Any Style with Training-free Diffusion
por: Xu, Youcan, et al.
Publicado: (2024)
por: Xu, Youcan, et al.
Publicado: (2024)
Expanding Scene Graph Boundaries: Fully Open-vocabulary Scene Graph Generation via Visual-Concept Alignment and Retention
por: Chen, Zuyao, et al.
Publicado: (2023)
por: Chen, Zuyao, et al.
Publicado: (2023)
GPT4SGG: Synthesizing Scene Graphs from Holistic and Region-specific Narratives
por: Chen, Zuyao, et al.
Publicado: (2023)
por: Chen, Zuyao, et al.
Publicado: (2023)
Polarization Wavefront Lidar: Learning Large Scene Reconstruction from Polarized Wavefronts
por: Scheuble, Dominik, et al.
Publicado: (2024)
por: Scheuble, Dominik, et al.
Publicado: (2024)
Generalized and Efficient 2D Gaussian Splatting for Arbitrary-scale Super-Resolution
por: Chen, Du, et al.
Publicado: (2025)
por: Chen, Du, et al.
Publicado: (2025)
Using Left and Right Brains Together: Towards Vision and Language Planning
por: Cen, Jun, et al.
Publicado: (2024)
por: Cen, Jun, et al.
Publicado: (2024)
MDReID: Modality-Decoupled Learning for Any-to-Any Multi-Modal Object Re-Identification
por: Feng, Yingying, et al.
Publicado: (2025)
por: Feng, Yingying, et al.
Publicado: (2025)
PAM: A Propagation-Based Model for Segmenting Any 3D Objects across Multi-Modal Medical Images
por: Chen, Zifan, et al.
Publicado: (2024)
por: Chen, Zifan, et al.
Publicado: (2024)
Improving Large Vision-Language Models' Understanding for Flow Field Data
por: Zhang, Xiaomei, et al.
Publicado: (2025)
por: Zhang, Xiaomei, et al.
Publicado: (2025)
Adapting Vision Foundation Models for Real-time Ultrasound Image Segmentation
por: Zhang, Xiaoran, et al.
Publicado: (2025)
por: Zhang, Xiaoran, et al.
Publicado: (2025)
All-in-One: Transferring Vision Foundation Models into Stereo Matching
por: Zhou, Jingyi, et al.
Publicado: (2024)
por: Zhou, Jingyi, et al.
Publicado: (2024)
DiT4Edit: Diffusion Transformer for Image Editing
por: Feng, Kunyu, et al.
Publicado: (2024)
por: Feng, Kunyu, et al.
Publicado: (2024)
CoCoEdit: Content-Consistent Image Editing via Region Regularized Reinforcement Learning
por: Wu, Yuhui, et al.
Publicado: (2026)
por: Wu, Yuhui, et al.
Publicado: (2026)
Transferability Bound Theory: Exploring Relationship between Adversarial Transferability and Flatness
por: Fan, Mingyuan, et al.
Publicado: (2023)
por: Fan, Mingyuan, et al.
Publicado: (2023)
4D Panoptic Scene Graph Generation
por: Yang, Jingkang, et al.
Publicado: (2024)
por: Yang, Jingkang, et al.
Publicado: (2024)
One2Scene: Geometric Consistent Explorable 3D Scene Generation from a Single Image
por: Wang, Pengfei, et al.
Publicado: (2026)
por: Wang, Pengfei, et al.
Publicado: (2026)
4M-21: An Any-to-Any Vision Model for Tens of Tasks and Modalities
por: Bachmann, Roman, et al.
Publicado: (2024)
por: Bachmann, Roman, et al.
Publicado: (2024)
AnyMo: Scaling Any-Modality Conditional Motion Generation with Masked Modeling
por: Li, Yiheng, et al.
Publicado: (2026)
por: Li, Yiheng, et al.
Publicado: (2026)
Generative Active Learning for Image Synthesis Personalization
por: Zhang, Xulu, et al.
Publicado: (2024)
por: Zhang, Xulu, et al.
Publicado: (2024)
Voxel Mamba: Group-Free State Space Models for Point Cloud based 3D Object Detection
por: Zhang, Guowen, et al.
Publicado: (2024)
por: Zhang, Guowen, et al.
Publicado: (2024)
RSRefSeg 2: Decoupling Referring Remote Sensing Image Segmentation with Foundation Models
por: Chen, Keyan, et al.
Publicado: (2025)
por: Chen, Keyan, et al.
Publicado: (2025)
Cross-Modal Obfuscation for Jailbreak Attacks on Large Vision-Language Models
por: Jiang, Lei, et al.
Publicado: (2025)
por: Jiang, Lei, et al.
Publicado: (2025)
RSRefSeg: Referring Remote Sensing Image Segmentation with Foundation Models
por: Chen, Keyan, et al.
Publicado: (2025)
por: Chen, Keyan, et al.
Publicado: (2025)
Top-Down Guidance for Learning Object-Centric Representations
por: Zou, Junhong, et al.
Publicado: (2024)
por: Zou, Junhong, et al.
Publicado: (2024)
Scaffolding Coordinates to Promote Vision-Language Coordination in Large Multi-Modal Models
por: Lei, Xuanyu, et al.
Publicado: (2024)
por: Lei, Xuanyu, et al.
Publicado: (2024)
DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer
por: Ma, Zhiyuan, et al.
Publicado: (2024)
por: Ma, Zhiyuan, et al.
Publicado: (2024)
MoKus: Leveraging Cross-Modal Knowledge Transfer for Knowledge-Aware Concept Customization
por: Zhu, Chenyang, et al.
Publicado: (2026)
por: Zhu, Chenyang, et al.
Publicado: (2026)
Fast Multi-view Consistent 3D Editing with Video Priors
por: Chen, Liyi, et al.
Publicado: (2025)
por: Chen, Liyi, et al.
Publicado: (2025)
Omni-3DEdit: Generalized Versatile 3D Editing in One-Pass
por: Liyi, Chen, et al.
Publicado: (2026)
por: Liyi, Chen, et al.
Publicado: (2026)
Segment Any 3D Gaussians
por: Cen, Jiazhong, et al.
Publicado: (2023)
por: Cen, Jiazhong, et al.
Publicado: (2023)
Seek for Incantations: Towards Accurate Text-to-Image Diffusion Synthesis through Prompt Engineering
por: Yu, Chang, et al.
Publicado: (2024)
por: Yu, Chang, et al.
Publicado: (2024)
SimMLM: A Simple Framework for Multi-modal Learning with Missing Modality
por: Li, Sijie, et al.
Publicado: (2025)
por: Li, Sijie, et al.
Publicado: (2025)
Ejemplares similares
-
SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality
por: Lei, Chenyang, et al.
Publicado: (2024) -
Robust Depth Enhancement via Polarization Prompt Fusion Tuning
por: Ikemura, Kei, et al.
Publicado: (2024) -
General Geometry-aware Weakly Supervised 3D Object Detection
por: Zhang, Guowen, et al.
Publicado: (2024) -
FIRM: Flexible Interactive Reflection reMoval
por: Chen, Xiao, et al.
Publicado: (2024) -
Automatic Controllable Colorization via Imagination
por: Cong, Xiaoyan, et al.
Publicado: (2024)