Rewrite the Stars
Fuente:
arXiv
Salvato in:
| Autori principali: | Ma, Xu, Dai, Xiyang, Bai, Yue, Wang, Yizhou, Fu, Yun |
|---|---|
| Natura: | Preprint |
| Pubblicazione: |
2024
|
| Soggetti: | |
| Accesso online: | |
| Tags: |
Aggiungi Tag
Nessun Tag, puoi essere il primo ad aggiungerne!!
|
Documenti analoghi
Efficient Modulation for Vision Networks
di: Ma, Xu, et al.
Pubblicazione: (2024)
di: Ma, Xu, et al.
Pubblicazione: (2024)
Don't Judge by the Look: Towards Motion Coherent Video Representation
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
Towards Zero-shot 3D Anomaly Localization
di: Wang, Yizhou, et al.
Pubblicazione: (2024)
di: Wang, Yizhou, et al.
Pubblicazione: (2024)
Arbitrary-Scale 3D Gaussian Super-Resolution
di: Zeng, Huimin, et al.
Pubblicazione: (2025)
di: Zeng, Huimin, et al.
Pubblicazione: (2025)
Physically Inspired Gaussian Splatting for HDR Novel View Synthesis
di: Zeng, Huimin, et al.
Pubblicazione: (2026)
di: Zeng, Huimin, et al.
Pubblicazione: (2026)
D-CoDe: Scaling Image-Pretrained VLMs to Video via Dynamic Compression and Question Decomposition
di: Huang, Yiyang, et al.
Pubblicazione: (2025)
di: Huang, Yiyang, et al.
Pubblicazione: (2025)
Hierarchical Visual Agent: Managing Contexts in Joint Image-Text Space for Advanced Chart Reasoning
di: Dong, Qihua, et al.
Pubblicazione: (2026)
di: Dong, Qihua, et al.
Pubblicazione: (2026)
Accessing Vision Foundation Models via ImageNet-1K
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
di: Zhang, Yitian, et al.
Pubblicazione: (2024)
Rewrite Caption Semantics: Bridging Semantic Gaps for Language-Supervised Semantic Segmentation
di: Xing, Yun, et al.
Pubblicazione: (2023)
di: Xing, Yun, et al.
Pubblicazione: (2023)
StructRe: Rewriting for Structured Shape Modeling
di: Wang, Jiepeng, et al.
Pubblicazione: (2023)
di: Wang, Jiepeng, et al.
Pubblicazione: (2023)
SegMAN: Omni-scale Context Modeling with State Space Models and Local Attention for Semantic Segmentation
di: Fu, Yunxiang, et al.
Pubblicazione: (2024)
di: Fu, Yunxiang, et al.
Pubblicazione: (2024)
SparX: A Sparse Cross-Layer Connection Mechanism for Hierarchical Vision Mamba and Transformer Networks
di: Lou, Meng, et al.
Pubblicazione: (2024)
di: Lou, Meng, et al.
Pubblicazione: (2024)
LaMamba-Diff: Linear-Time High-Fidelity Diffusion Models Based on Local Attention and Mamba
di: Fu, Yunxiang, et al.
Pubblicazione: (2024)
di: Fu, Yunxiang, et al.
Pubblicazione: (2024)
A2Mamba: Attention-augmented State Space Models for Visual Recognition
di: Lou, Meng, et al.
Pubblicazione: (2025)
di: Lou, Meng, et al.
Pubblicazione: (2025)
Rethinking Fine-Tuning: Unlocking Hidden Capabilities in Vision-Language Models
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
di: Zhang, Mingyuan, et al.
Pubblicazione: (2025)
Causal Intervention for Subject-Deconfounded Facial Action Unit Recognition
di: Chen, Yingjie, et al.
Pubblicazione: (2022)
di: Chen, Yingjie, et al.
Pubblicazione: (2022)
Fine-T2I: An Open, Large-Scale, and Diverse Dataset for High-Quality T2I Fine-Tuning
di: Ma, Xu, et al.
Pubblicazione: (2026)
di: Ma, Xu, et al.
Pubblicazione: (2026)
Sports-Traj: A Unified Trajectory Generation Model for Multi-Agent Movement in Sports
di: Xu, Yi, et al.
Pubblicazione: (2024)
di: Xu, Yi, et al.
Pubblicazione: (2024)
Adapting to Length Shift: FlexiLength Network for Trajectory Prediction
di: Xu, Yi, et al.
Pubblicazione: (2024)
di: Xu, Yi, et al.
Pubblicazione: (2024)
AdaSports-Traj: Role- and Domain-Aware Adaptation for Multi-Agent Trajectory Modeling in Sports
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
Trajectory Prediction Meets Large Language Models: A Survey
di: Xu, Yi, et al.
Pubblicazione: (2025)
di: Xu, Yi, et al.
Pubblicazione: (2025)
FastRef:Fast Prototype Refinement for Few-Shot Industrial Anomaly Detection
di: Tian, Long, et al.
Pubblicazione: (2025)
di: Tian, Long, et al.
Pubblicazione: (2025)
WikiStyle+: A Multimodal Approach to Content-Style Representation Disentanglement for Artistic Image Stylization
di: Zhuoqi, Ma, et al.
Pubblicazione: (2024)
di: Zhuoqi, Ma, et al.
Pubblicazione: (2024)
SAT-HMR: Real-Time Multi-Person 3D Mesh Estimation via Scale-Adaptive Tokens
di: Su, Chi, et al.
Pubblicazione: (2024)
di: Su, Chi, et al.
Pubblicazione: (2024)
Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings
di: Wu, Peixi, et al.
Pubblicazione: (2026)
di: Wu, Peixi, et al.
Pubblicazione: (2026)
OmniTracker: Unifying Object Tracking by Tracking-with-Detection
di: Wang, Junke, et al.
Pubblicazione: (2023)
di: Wang, Junke, et al.
Pubblicazione: (2023)
UnAC: Adaptive Visual Prompting with Abstraction and Stepwise Checking for Complex Multimodal Reasoning
di: Wang, Yifan, et al.
Pubblicazione: (2026)
di: Wang, Yifan, et al.
Pubblicazione: (2026)
You Only Need Two Detectors to Achieve Multi-Modal 3D Multi-Object Tracking
di: Wang, Xiyang, et al.
Pubblicazione: (2023)
di: Wang, Xiyang, et al.
Pubblicazione: (2023)
DreamDA: Generative Data Augmentation with Diffusion Models
di: Fu, Yunxiang, et al.
Pubblicazione: (2024)
di: Fu, Yunxiang, et al.
Pubblicazione: (2024)
Infrared UAV Target Tracking with Dynamic Feature Refinement and Global Contextual Attention Knowledge Distillation
di: Fang, Houzhang, et al.
Pubblicazione: (2025)
di: Fang, Houzhang, et al.
Pubblicazione: (2025)
3D Human Mesh Estimation from Virtual Markers
di: Ma, Xiaoxuan, et al.
Pubblicazione: (2023)
di: Ma, Xiaoxuan, et al.
Pubblicazione: (2023)
GRAPE: Let GRPO Supervise Query Rewriting by Ranking for Retrieval
di: Zhang, Zhaohua, et al.
Pubblicazione: (2025)
di: Zhang, Zhaohua, et al.
Pubblicazione: (2025)
StarLKNet: Star Mixup with Large Kernel Networks for Palm Vein Identification
di: Jin, Xin, et al.
Pubblicazione: (2024)
di: Jin, Xin, et al.
Pubblicazione: (2024)
Divide and Conquer: Object Co-occurrence Helps Mitigate Simplicity Bias in OOD Detection
di: Dai, Boyang, et al.
Pubblicazione: (2026)
di: Dai, Boyang, et al.
Pubblicazione: (2026)
CMT: A Cascade MAR with Topology Predictor for Multimodal Conditional CAD Generation
di: Wu, Jianyu, et al.
Pubblicazione: (2025)
di: Wu, Jianyu, et al.
Pubblicazione: (2025)
Through the Theory of Mind's Eye: Reading Minds with Multimodal Video Large Language Models
di: Chen, Zhawnen, et al.
Pubblicazione: (2024)
di: Chen, Zhawnen, et al.
Pubblicazione: (2024)
Autoregressive Sequence Modeling for 3D Medical Image Representation
di: Wang, Siwen, et al.
Pubblicazione: (2024)
di: Wang, Siwen, et al.
Pubblicazione: (2024)
RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation
di: Pang, Lexi, et al.
Pubblicazione: (2025)
di: Pang, Lexi, et al.
Pubblicazione: (2025)
DeepStack: Deeply Stacking Visual Tokens is Surprisingly Simple and Effective for LMMs
di: Meng, Lingchen, et al.
Pubblicazione: (2024)
di: Meng, Lingchen, et al.
Pubblicazione: (2024)
Tailored Visions: Enhancing Text-to-Image Generation with Personalized Prompt Rewriting
di: Chen, Zijie, et al.
Pubblicazione: (2023)
di: Chen, Zijie, et al.
Pubblicazione: (2023)
Documenti analoghi
-
Efficient Modulation for Vision Networks
di: Ma, Xu, et al.
Pubblicazione: (2024) -
Don't Judge by the Look: Towards Motion Coherent Video Representation
di: Zhang, Yitian, et al.
Pubblicazione: (2024) -
Towards Zero-shot 3D Anomaly Localization
di: Wang, Yizhou, et al.
Pubblicazione: (2024) -
Arbitrary-Scale 3D Gaussian Super-Resolution
di: Zeng, Huimin, et al.
Pubblicazione: (2025) -
Physically Inspired Gaussian Splatting for HDR Novel View Synthesis
di: Zeng, Huimin, et al.
Pubblicazione: (2026)