Ir para o conteúdo Studio Crie imagens e vídeos sem viver dentro da cadeia de ferramentas de IA.
Um espaço de trabalho local-primeiro para transformar fluxos de trabalho ComfyUI em ferramentas que você pode usar, entender e retornar.
© 2026 Tea Time Labs
Criação local com IA, organizada.
Tem um workflow do ComfyUI? Gere uma documentação legível direto no navegador. Torne um workflow legível. Experimentar agora ↗
VisionEncoder | ST Studio
Recursos / VisionEncoder VisionEncoder license: apache-2.0 libraryname: transformers tags: vision-encoder distillation video-language siglip2 dinov3
license: apache-2.0 libraryname: transformers tags: vision-encoder distillation video-language siglip2 dinov3
Tipo Checkpoint Modelo base Qwen3 Versão mp_rank_00_model_states model-00001-of-00002 model-00002-of-00002 model-00001-of-00002 model-00002-of-00002 model-00001-of-00002 model-00002-of-00002 model-00001-of-00002 model-00002-of-00002 bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model-00001-of-00002 model-00002-of-00002 bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model-00001-of-00002 model-00002-of-00002 bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model
Fonte do modelo
Tipo Checkpoint
Tamanho do arquivo 596 MB
Modelo base Qwen3
Versão vmp_rank_00_model_states
Atualizado 5 de jun. de 2026
Parâmetros 4B
Fonte Hugging Face VisionEncoder
Hosted artifacts (derived data + trained checkpoints) for the VisionEncoder research project.
Training code + full reproduction guide : https://github.com/xiaomoguhz/VisionEncoder
The repo is organized into three top-level folders.
— current (V9.x) reproduction data (~6.5G)
Artefatos de modelo
1 artefato ckpts/S0/qwen3_5_2b/v10_2/step000348/mp_rank_00_model_states.pt
pt · 596 MB · SHA-256 a7f86a4a9fb1…35b5 · Hugging Face
Baixar Trechos de fonte
3 trechos C nota
data/
Path Content data/vmllm_cached/qwen3vit/S2 cached_dataset arrow (image/video, 10pct + full); fed directly to stage-2 data/ms-swift-data/sampled sharegpt jsonl (10pct + full) data/llava_video/V9 decode-probed good_manifest for the video path
ckpts/ — ready-made 4B MLLM inference weightsPath Content ckpts/4b_stock4B stock baseline (raw Qwen3.5 ViT, skips declip), checkpoint-505, 9.5G ckpts/4b_v9_14B V9.1 (V-JEPA 2.1 video self-distill), checkpoint-505, 9.5G
Download either and feed it straight to evaluation (see the GitHub README, section 4 — MLLM evaluation) to skip declip + S1 + S2.
legacy/ — historical assets (~368G)Early-line products, not needed to reproduce the current main line: declip_siglip2/spatial_align, kd_mllm, self_refine, video_mllm_swift (old SigLIP2 / image-only S1+S2 ckpts), and old ViT-family arrow caches.
Download # current dev data
huggingface-cli download xiaomoguhzz/VisionEncoder --include "data/*" --local-dir .
# ready-made 4B MLLM ckpt (eval directly)
huggingface-cli download xiaomoguhzz/VisionEncoder --include "ckpts/4b_v9_1/*" --local-dir .
Related 11 de jul.
---
license: apache-2.0
library_name: transformers
tags:
- vision-encoder
- distillation
- video-language
- siglip2
- dinov3
---
# VisionEncoder
Hosted artifacts (derived data + trained checkpoints) for the **VisionEncoder** research project.
**Training code + full reproduction guide**: https://github.com/xiaomoguhz/VisionEncoder
The repo is organized into three top-level folders.
## `data/` — current (V9.x) reproduction data (~6.5G)
| Path | Content |
|---|---|
| `data/vmllm_cached/qwen3vit/` | S2 `cached_dataset` arrow (image/video, 10pct + full); fed directly to stage-2 |
| `data/ms-swift-data/` | sampled sharegpt jsonl (10pct + full) |
| `data/llava_video/` | V9 decode-probed `good_manifest` for the video path |
## `ckpts/` — ready-made 4B MLLM inference weights
| Path | Content |
|---|---|
| `ckpts/4b_stock` | 4B stock baseline (raw Qwen3.5 ViT, skips declip), checkpoint-505, 9.5G |
| `ckpts/4b_v9_1` | 4B V9.1 (V-JEPA 2.1 video self-distill), checkpoint-505, 9.5G |
Download either and feed it straight to evaluation (see the GitHub README, section 4 — MLLM evaluation) to skip declip + S1 + S2.
## `legacy/` — historical assets (~368G)
Early-line products, not needed to reproduce the current main line: `declip_siglip2/spatial_align`, `kd_mllm`, `self_refine`, `video_mllm_swift` (old SigLIP2 / image-only S1+S2 ckpts), and old ViT-family arrow caches.
## Download
```bash
# current dev data
huggingface-cli download xiaomoguhzz/VisionEncoder --include "data/*" --local-dir .
# ready-made 4B MLLM ckpt (eval directly)
huggingface-cli download xiaomoguhzz/VisionEncoder --include "ckpts/4b_v9_1/*" --local-dir .
```
## Related
- Code + reproduction guide: https://github.com/xiaomoguhz/VisionEncoder
Source context: 0 downloads · 0 likes · Library transformers · Repo xiaomoguhzz/VisionEncoder
Source context: 0 downloads · 0 likes · Library transformers · Repo xiaomoguhzz/VisionEncoder