Seg the HAB: Language-Guided Geospatial Algae Bloom Reasoning and Segmentation
Fuente:
arXiv
Guardado en:
| Autores principales: | Hsieh, Patterson, Yeh, Jerry, He, Mao-Chi, Hsieh, Wen-Han, Hsieh, Elvis |
|---|---|
| Formato: | Preprint |
| Publicado: |
2025
|
| Materias: | |
| Acceso en línea: | |
| Etiquetas: |
Agregar Etiqueta
Sin Etiquetas, Sea el primero en etiquetar este registro!
|
Ejemplares similares
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
por: Hsieh, ZongHan, et al.
Publicado: (2025)
por: Hsieh, ZongHan, et al.
Publicado: (2025)
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
por: Hao, Chao, et al.
Publicado: (2026)
por: Hao, Chao, et al.
Publicado: (2026)
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
por: Bai, Zechen, et al.
Publicado: (2024)
por: Bai, Zechen, et al.
Publicado: (2024)
SegLLM: Multi-round Reasoning Segmentation
por: Wang, XuDong, et al.
Publicado: (2024)
por: Wang, XuDong, et al.
Publicado: (2024)
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
por: Du, Wanjun, et al.
Publicado: (2026)
por: Du, Wanjun, et al.
Publicado: (2026)
Construction Site Scaffolding Completeness Detection Based on Mask R-CNN and Hough Transform
por: Lin, Pei-Hsin, et al.
Publicado: (2025)
por: Lin, Pei-Hsin, et al.
Publicado: (2025)
One-Forcing: Towards Stable One-Step Autoregressive Video Generation
por: Feng, Jiaqi, et al.
Publicado: (2026)
por: Feng, Jiaqi, et al.
Publicado: (2026)
Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval
por: Shen, Li-Cheng, et al.
Publicado: (2025)
por: Shen, Li-Cheng, et al.
Publicado: (2025)
Decoupled Seg Tokens Make Stronger Reasoning Video Segmenter and Grounder
por: Jisheng, Dang, et al.
Publicado: (2025)
por: Jisheng, Dang, et al.
Publicado: (2025)
Perception Tokens Enhance Visual Reasoning in Multimodal Language Models
por: Bigverdi, Mahtab, et al.
Publicado: (2024)
por: Bigverdi, Mahtab, et al.
Publicado: (2024)
GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery
por: Jiang, Lifan, et al.
Publicado: (2026)
por: Jiang, Lifan, et al.
Publicado: (2026)
CORE-Seg: Reasoning-Driven Segmentation for Complex Lesions via Reinforcement Learning
por: Xie, Yuxin, et al.
Publicado: (2026)
por: Xie, Yuxin, et al.
Publicado: (2026)
DiffSeg: A Segmentation Model for Skin Lesions Based on Diffusion Difference
por: Shuai, Zhihao, et al.
Publicado: (2024)
por: Shuai, Zhihao, et al.
Publicado: (2024)
Text is All You Need for Vision-Language Model Jailbreaking
por: Chen, Yihang, et al.
Publicado: (2026)
por: Chen, Yihang, et al.
Publicado: (2026)
Gen4Gen: Generative Data Pipeline for Generative Multi-Concept Composition
por: Yeh, Chun-Hsiao, et al.
Publicado: (2024)
por: Yeh, Chun-Hsiao, et al.
Publicado: (2024)
QG-CoC: Question-Guided Chain-of-Captions for Large Multimodal Models
por: Kao, Kuei-Chun, et al.
Publicado: (2025)
por: Kao, Kuei-Chun, et al.
Publicado: (2025)
Very Efficient Listwise Multimodal Reranking for Long Documents
por: Sun, Yiqun, et al.
Publicado: (2026)
por: Sun, Yiqun, et al.
Publicado: (2026)
Graph-Based Captioning: Enhancing Visual Descriptions by Interconnecting Region Captions
por: Hsieh, Yu-Guan, et al.
Publicado: (2024)
por: Hsieh, Yu-Guan, et al.
Publicado: (2024)
TinyFormer: Preserving Tiny Objects in YOLO-DETR Hybrid Real-time Detectors
por: Hsieh, Jun-Wei, et al.
Publicado: (2026)
por: Hsieh, Jun-Wei, et al.
Publicado: (2026)
R1-Zero's "Aha Moment" in Visual Reasoning on a 2B Non-SFT Model
por: Zhou, Hengguang, et al.
Publicado: (2025)
por: Zhou, Hengguang, et al.
Publicado: (2025)
LarvSeg: Exploring Image Classification Data For Large Vocabulary Semantic Segmentation via Category-wise Attentive Classifier
por: Yu, Haojun, et al.
Publicado: (2025)
por: Yu, Haojun, et al.
Publicado: (2025)
Mitigating Bias in Dataset Distillation
por: Cui, Justin, et al.
Publicado: (2024)
por: Cui, Justin, et al.
Publicado: (2024)
The Crystal Ball Hypothesis in diffusion models: Anticipating object positions from initial noise
por: Ban, Yuanhao, et al.
Publicado: (2024)
por: Ban, Yuanhao, et al.
Publicado: (2024)
Text2Seg: Remote Sensing Image Semantic Segmentation via Text-Guided Visual Foundation Models
por: Zhang, Jielu, et al.
Publicado: (2023)
por: Zhang, Jielu, et al.
Publicado: (2023)
R$^{2}$Seg: Training-Free OOD Medical Tumor Segmentation via Anatomical Reasoning and Statistical Rejection
por: Shen, Shuaike, et al.
Publicado: (2025)
por: Shen, Shuaike, et al.
Publicado: (2025)
Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding
por: Yao, Yuan, et al.
Publicado: (2026)
por: Yao, Yuan, et al.
Publicado: (2026)
Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models
por: Hong, Yunqi, et al.
Publicado: (2025)
por: Hong, Yunqi, et al.
Publicado: (2025)
AutoRubric-T2I: Robust Rule-Based Reward Model for Text-to-Image Alignment
por: Kao, Kuei-Chun, et al.
Publicado: (2026)
por: Kao, Kuei-Chun, et al.
Publicado: (2026)
GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation
por: Hegde, Sandesh, et al.
Publicado: (2026)
por: Hegde, Sandesh, et al.
Publicado: (2026)
IRIS: Intrinsic Reward Image Synthesis
por: Chen, Yihang, et al.
Publicado: (2025)
por: Chen, Yihang, et al.
Publicado: (2025)
Navigating Text-To-Image Customization: From LyCORIS Fine-Tuning to Model Evaluation
por: Yeh, Shih-Ying, et al.
Publicado: (2023)
por: Yeh, Shih-Ying, et al.
Publicado: (2023)
MatchSeg: Towards Better Segmentation via Reference Image Matching
por: Huo, Jiayu, et al.
Publicado: (2024)
por: Huo, Jiayu, et al.
Publicado: (2024)
G4Seg: Generation for Inexact Segmentation Refinement with Diffusion Models
por: Zhang, Tianjiao, et al.
Publicado: (2025)
por: Zhang, Tianjiao, et al.
Publicado: (2025)
BiPVL-Seg: Bidirectional Progressive Vision-Language Fusion with Global-Local Alignment for Medical Image Segmentation
por: Sultan, Rafi Ibn, et al.
Publicado: (2025)
por: Sultan, Rafi Ibn, et al.
Publicado: (2025)
TAO-Amodal: A Benchmark for Tracking Any Object Amodally
por: Hsieh, Cheng-Yen, et al.
Publicado: (2023)
por: Hsieh, Cheng-Yen, et al.
Publicado: (2023)
AttrSeg: Open-Vocabulary Semantic Segmentation via Attribute Decomposition-Aggregation
por: Ma, Chaofan, et al.
Publicado: (2023)
por: Ma, Chaofan, et al.
Publicado: (2023)
SegMix:Shuffle-based Feedback Learning for Semantic Segmentation of Pathology Images
por: Yan, Zhiling, et al.
Publicado: (2026)
por: Yan, Zhiling, et al.
Publicado: (2026)
CSAD: Unsupervised Component Segmentation for Logical Anomaly Detection
por: Hsieh, Yu-Hsuan, et al.
Publicado: (2024)
por: Hsieh, Yu-Hsuan, et al.
Publicado: (2024)
Neural Network-Based Tracking and 3D Reconstruction of Baseball Pitch Trajectories from Single-View 2D Video
por: Hsieh, Jhen
Publicado: (2024)
por: Hsieh, Jhen
Publicado: (2024)
Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs
por: Hong, Yunqi, et al.
Publicado: (2025)
por: Hong, Yunqi, et al.
Publicado: (2025)
Ejemplares similares
-
ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding
por: Hsieh, ZongHan, et al.
Publicado: (2025) -
Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation
por: Hao, Chao, et al.
Publicado: (2026) -
One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos
por: Bai, Zechen, et al.
Publicado: (2024) -
SegLLM: Multi-round Reasoning Segmentation
por: Wang, XuDong, et al.
Publicado: (2024) -
WeatherReasonSeg: A Benchmark for Weather-Aware Reasoning Segmentation in Visual Language Models
por: Du, Wanjun, et al.
Publicado: (2026)