Saltar al contenido Studio Crea imágenes y vídeo sin vivir dentro de la cadena de herramientas de IA.
Un espacio local para convertir flujos de ComfyUI en herramientas que puedas usar, entender y retomar.
© 2026 Tea Time Labs
Creación con IA local, organizada.
¿Tienes un flujo de trabajo de ComfyUI? Obtén un Workflow Doc legible en tu navegador. Haz legible un flujo de trabajo. Pruébalo ahora ↗
VisionEncoder | ST Studio
Recursos / VisionEncoder VisionEncoder license: apache-2.0 libraryname: transformers tags: vision-encoder distillation video-language siglip2 dinov3
license: apache-2.0 libraryname: transformers tags: vision-encoder distillation video-language siglip2 dinov3
Tipo Checkpoint Modelo base Qwen3 Versión mp_rank_00_model_states model-00001-of-00002 model-00002-of-00002 model-00001-of-00002 model-00002-of-00002 model-00001-of-00002 model-00002-of-00002 model-00001-of-00002 model-00002-of-00002 bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model-00001-of-00002 model-00002-of-00002 bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model-00001-of-00002 model-00002-of-00002 bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model
Fuente del modelo
Tipo Checkpoint
Tamaño del archivo 596 MB
Modelo base Qwen3
Versión vmp_rank_00_model_states
Actualizado 5 jun 2026
Parámetros 4B
Fuente Hugging Face VisionEncoder
Hosted artifacts (derived data + trained checkpoints) for the VisionEncoder research project.
Training code + full reproduction guide : https://github.com/xiaomoguhz/VisionEncoder
The repo is organized into three top-level folders.
— current (V9.x) reproduction data (~6.5G)
Artefactos del modelo
1 artefacto ckpts/S0/qwen3_5_2b/v10_2/step000348/mp_rank_00_model_states.pt
pt · 596 MB · SHA-256 a7f86a4a9fb1…35b5 · Hugging Face
Descargar Extractos de fuentes
3 extractos C calidad
data/
Path Content data/vmllm_cached/qwen3vit/S2 cached_dataset arrow (image/video, 10pct + full); fed directly to stage-2 data/ms-swift-data/sampled sharegpt jsonl (10pct + full) data/llava_video/V9 decode-probed good_manifest for the video path
ckpts/ — ready-made 4B MLLM inference weightsPath Content ckpts/4b_stock4B stock baseline (raw Qwen3.5 ViT, skips declip), checkpoint-505, 9.5G ckpts/4b_v9_14B V9.1 (V-JEPA 2.1 video self-distill), checkpoint-505, 9.5G
Download either and feed it straight to evaluation (see the GitHub README, section 4 — MLLM evaluation) to skip declip + S1 + S2.
legacy/ — historical assets (~368G)Early-line products, not needed to reproduce the current main line: declip_siglip2/spatial_align, kd_mllm, self_refine, video_mllm_swift (old SigLIP2 / image-only S1+S2 ckpts), and old ViT-family arrow caches.
Download # current dev data
huggingface-cli download xiaomoguhzz/VisionEncoder --include "data/*" --local-dir .
# ready-made 4B MLLM ckpt (eval directly)
huggingface-cli download xiaomoguhzz/VisionEncoder --include "ckpts/4b_v9_1/*" --local-dir .
Related 11 jul
---
license: apache-2.0
library_name: transformers
tags:
- vision-encoder
- distillation
- video-language
- siglip2
- dinov3
---
# VisionEncoder
Hosted artifacts (derived data + trained checkpoints) for the **VisionEncoder** research project.
**Training code + full reproduction guide**: https://github.com/xiaomoguhz/VisionEncoder
The repo is organized into three top-level folders.
## `data/` — current (V9.x) reproduction data (~6.5G)
| Path | Content |
|---|---|
| `data/vmllm_cached/qwen3vit/` | S2 `cached_dataset` arrow (image/video, 10pct + full); fed directly to stage-2 |
| `data/ms-swift-data/` | sampled sharegpt jsonl (10pct + full) |
| `data/llava_video/` | V9 decode-probed `good_manifest` for the video path |
## `ckpts/` — ready-made 4B MLLM inference weights
| Path | Content |
|---|---|
| `ckpts/4b_stock` | 4B stock baseline (raw Qwen3.5 ViT, skips declip), checkpoint-505, 9.5G |
| `ckpts/4b_v9_1` | 4B V9.1 (V-JEPA 2.1 video self-distill), checkpoint-505, 9.5G |
Download either and feed it straight to evaluation (see the GitHub README, section 4 — MLLM evaluation) to skip declip + S1 + S2.
## `legacy/` — historical assets (~368G)
Early-line products, not needed to reproduce the current main line: `declip_siglip2/spatial_align`, `kd_mllm`, `self_refine`, `video_mllm_swift` (old SigLIP2 / image-only S1+S2 ckpts), and old ViT-family arrow caches.
## Download
```bash
# current dev data
huggingface-cli download xiaomoguhzz/VisionEncoder --include "data/*" --local-dir .
# ready-made 4B MLLM ckpt (eval directly)
huggingface-cli download xiaomoguhzz/VisionEncoder --include "ckpts/4b_v9_1/*" --local-dir .
```
## Related
- Code + reproduction guide: https://github.com/xiaomoguhz/VisionEncoder
Source context: 0 downloads · 0 likes · Library transformers · Repo xiaomoguhzz/VisionEncoder
Source context: 0 downloads · 0 likes · Library transformers · Repo xiaomoguhzz/VisionEncoder