Consistency of Compositional Generalization across Multiple Levels
Fuente:
arXiv
Guardado en:
| Autores principales: | Li, Chuanhao, Li, Zhen, Jing, Chenchen, Fan, Xiaomeng, Ye, Wenbo, Wu, Yuwei, Jia, Yunde |
|---|---|
| Formato: | Preprint |
| Publicado: |
2024
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
Multi-Sourced Compositional Generalization in Visual Question Answering
por: Li, Chuanhao, et al.
Publicado: (2025)
por: Li, Chuanhao, et al.
Publicado: (2025)
Composition-Incremental Learning for Compositional Generalization
por: Li, Zhen, et al.
Publicado: (2025)
por: Li, Zhen, et al.
Publicado: (2025)
SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
por: Li, Chuanhao, et al.
Publicado: (2024)
por: Li, Chuanhao, et al.
Publicado: (2024)
Adaptive Model Ensemble for Continual Learning
por: Mao, Yuchuan, et al.
Publicado: (2025)
por: Mao, Yuchuan, et al.
Publicado: (2025)
Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds
por: Wu, Wei, et al.
Publicado: (2025)
por: Wu, Wei, et al.
Publicado: (2025)
Curvature Learning for Generalization of Hyperbolic Neural Networks
por: Fan, Xiaomeng, et al.
Publicado: (2025)
por: Fan, Xiaomeng, et al.
Publicado: (2025)
Multi-modal Agent Tuning: Building a VLM-Driven Agent for Efficient Tool Usage
por: Gao, Zhi, et al.
Publicado: (2024)
por: Gao, Zhi, et al.
Publicado: (2024)
Temporally Consistent Stereo Matching
por: Zeng, Jiaxi, et al.
Publicado: (2024)
por: Zeng, Jiaxi, et al.
Publicado: (2024)
Sekai: A Video Dataset towards World Exploration
por: Li, Zhen, et al.
Publicado: (2025)
por: Li, Zhen, et al.
Publicado: (2025)
Large-Scale Riemannian Meta-Optimization via Subspace Adaptation
por: Yu, Peilin, et al.
Publicado: (2025)
por: Yu, Peilin, et al.
Publicado: (2025)
Hyperbolic Dual Feature Augmentation for Open-Environment
por: Yu, Peilin, et al.
Publicado: (2025)
por: Yu, Peilin, et al.
Publicado: (2025)
Dual Consistent Constraint via Disentangled Consistency and Complementarity for Multi-view Clustering
por: Li, Bo, et al.
Publicado: (2025)
por: Li, Bo, et al.
Publicado: (2025)
Geometry-aware Distance Measure for Diverse Hierarchical Structures in Hyperbolic Spaces
por: Li, Pengxiang, et al.
Publicado: (2025)
por: Li, Pengxiang, et al.
Publicado: (2025)
CoCoDiff: Correspondence-Consistent Diffusion Model for Fine-grained Style Transfer
por: Nie, Wenbo, et al.
Publicado: (2026)
por: Nie, Wenbo, et al.
Publicado: (2026)
Beyond the Seen: Bounded Distribution Estimation for Open-Vocabulary Learning
por: Fan, Xiaomeng, et al.
Publicado: (2025)
por: Fan, Xiaomeng, et al.
Publicado: (2025)
IA-T2I: Internet-Augmented Text-to-Image Generation
por: Li, Chuanhao, et al.
Publicado: (2025)
por: Li, Chuanhao, et al.
Publicado: (2025)
ZEBRA: Towards Zero-Shot Cross-Subject Generalization for Universal Brain Visual Decoding
por: Wang, Haonan, et al.
Publicado: (2025)
por: Wang, Haonan, et al.
Publicado: (2025)
Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation
por: Yang, Xiaomeng, et al.
Publicado: (2025)
por: Yang, Xiaomeng, et al.
Publicado: (2025)
Task Consistent Prototype Learning for Incremental Few-shot Semantic Segmentation
por: Xu, Wenbo, et al.
Publicado: (2024)
por: Xu, Wenbo, et al.
Publicado: (2024)
Human-Object Interaction from Human-Level Instructions
por: Wu, Zhen, et al.
Publicado: (2024)
por: Wu, Zhen, et al.
Publicado: (2024)
SridBench: Benchmark of Scientific Research Illustration Drawing of Image Generation Model
por: Chang, Yifan, et al.
Publicado: (2025)
por: Chang, Yifan, et al.
Publicado: (2025)
DropletVideo: A Dataset and Approach to Explore Integral Spatio-Temporal Consistent Video Generation
por: Zhang, Runze, et al.
Publicado: (2025)
por: Zhang, Runze, et al.
Publicado: (2025)
DepthCrafter: Generating Consistent Long Depth Sequences for Open-world Videos
por: Hu, Wenbo, et al.
Publicado: (2024)
por: Hu, Wenbo, et al.
Publicado: (2024)
DDaTR: Dynamic Difference-aware Temporal Residual Network for Longitudinal Radiology Report Generation
por: Song, Shanshan, et al.
Publicado: (2025)
por: Song, Shanshan, et al.
Publicado: (2025)
Echo-Path: Pathology-Conditioned Echo Video Generation
por: Muhammad, Kabir Hamzah, et al.
Publicado: (2025)
por: Muhammad, Kabir Hamzah, et al.
Publicado: (2025)
FastInit: Fast Noise Initialization for Temporally Consistent Video Generation
por: Bai, Chengyu, et al.
Publicado: (2025)
por: Bai, Chengyu, et al.
Publicado: (2025)
Instance-Level Trojan Attacks on Visual Question Answering via Adversarial Learning in Neuron Activation Space
por: Sun, Yuwei, et al.
Publicado: (2023)
por: Sun, Yuwei, et al.
Publicado: (2023)
Interact3D: Compositional 3D Generation of Interactive Objects
por: Shan, Hui, et al.
Publicado: (2026)
por: Shan, Hui, et al.
Publicado: (2026)
A Survey: Spatiotemporal Consistency in Video Generation
por: Yin, Zhiyu, et al.
Publicado: (2025)
por: Yin, Zhiyu, et al.
Publicado: (2025)
ARMOR: Empowering Multimodal Understanding Model with Interleaved Multimodal Generation Capability
por: Sun, Jianwen, et al.
Publicado: (2025)
por: Sun, Jianwen, et al.
Publicado: (2025)
VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation
por: Li, Mengtian, et al.
Publicado: (2026)
por: Li, Mengtian, et al.
Publicado: (2026)
Yume: An Interactive World Generation Model
por: Mao, Xiaofeng, et al.
Publicado: (2025)
por: Mao, Xiaofeng, et al.
Publicado: (2025)
An Organism Starts with a Single Pix-Cell: A Neural Cellular Diffusion for High-Resolution Image Synthesis
por: Elbatel, Marawan, et al.
Publicado: (2024)
por: Elbatel, Marawan, et al.
Publicado: (2024)
GeLoc3r: Enhancing Relative Camera Pose Regression with Geometric Consistency Regularization
por: Li, Jingxing, et al.
Publicado: (2025)
por: Li, Jingxing, et al.
Publicado: (2025)
AlignVAR: Towards Globally Consistent Visual Autoregression for Image Super-Resolution
por: Liu, Cencen, et al.
Publicado: (2026)
por: Liu, Cencen, et al.
Publicado: (2026)
FNBench: Benchmarking Robust Federated Learning against Noisy Labels
por: Jiang, Xuefeng, et al.
Publicado: (2025)
por: Jiang, Xuefeng, et al.
Publicado: (2025)
AllSpark: Reborn Labeled Features from Unlabeled in Transformer for Semi-Supervised Semantic Segmentation
por: Wang, Haonan, et al.
Publicado: (2024)
por: Wang, Haonan, et al.
Publicado: (2024)
UniEval: Unified Holistic Evaluation for Unified Multimodal Understanding and Generation
por: Li, Yi, et al.
Publicado: (2025)
por: Li, Yi, et al.
Publicado: (2025)
KAN-RCBEVDepth: A multi-modal fusion algorithm in object detection for autonomous driving
por: Lai, Zhihao, et al.
Publicado: (2024)
por: Lai, Zhihao, et al.
Publicado: (2024)
A High-Quality Dataset and Reliable Evaluation for Interleaved Image-Text Generation
por: Feng, Yukang, et al.
Publicado: (2025)
por: Feng, Yukang, et al.
Publicado: (2025)
Ejemplares similares
-
Multi-Sourced Compositional Generalization in Visual Question Answering
por: Li, Chuanhao, et al.
Publicado: (2025) -
Composition-Incremental Learning for Compositional Generalization
por: Li, Zhen, et al.
Publicado: (2025) -
SearchLVLMs: A Plug-and-Play Framework for Augmenting Large Vision-Language Models by Searching Up-to-Date Internet Knowledge
por: Li, Chuanhao, et al.
Publicado: (2024) -
Adaptive Model Ensemble for Continual Learning
por: Mao, Yuchuan, et al.
Publicado: (2025) -
Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds
por: Wu, Wei, et al.
Publicado: (2025)