Aller au contenu Studio Créez des images et des vidéos sans vivre dans la chaîne d’outils d’IA.
Un espace de travail local pour transformer les flux de travail ComfyUI en outils que vous pouvez utiliser, comprendre et retrouver.
© 2026 Tea Time Labs
Création locale par IA, bien organisée.
Vous avez un workflow ComfyUI ? Obtenez une documentation lisible directement dans votre navigateur. Rendre un workflow lisible. Essayer maintenant ↗
VisionEncoder | ST Studio
Ressources / VisionEncoder VisionEncoder license: apache-2.0 libraryname: transformers tags: vision-encoder distillation video-language siglip2 dinov3
license: apache-2.0 libraryname: transformers tags: vision-encoder distillation video-language siglip2 dinov3
Type Checkpoint Modèle de base Qwen3 Version mp_rank_00_model_states model-00001-of-00002 model-00002-of-00002 model-00001-of-00002 model-00002-of-00002 model-00001-of-00002 model-00002-of-00002 model-00001-of-00002 model-00002-of-00002 bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model-00001-of-00002 model-00002-of-00002 bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model-00001-of-00002 model-00002-of-00002 bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model bf16_zero_pp_rank_0_mp_rank_00_optim_states bf16_zero_pp_rank_1_mp_rank_00_optim_states bf16_zero_pp_rank_2_mp_rank_00_optim_states bf16_zero_pp_rank_3_mp_rank_00_optim_states bf16_zero_pp_rank_4_mp_rank_00_optim_states bf16_zero_pp_rank_5_mp_rank_00_optim_states bf16_zero_pp_rank_6_mp_rank_00_optim_states bf16_zero_pp_rank_7_mp_rank_00_optim_states mp_rank_00_model_states model
Source du modèle
Type Checkpoint
Taille du fichier 596 MB
Modèle de base Qwen3
Version vmp_rank_00_model_states
Mis à jour 5 juin 2026
Paramètres 4B
Source Hugging Face VisionEncoder
Hosted artifacts (derived data + trained checkpoints) for the VisionEncoder research project.
Training code + full reproduction guide : https://github.com/xiaomoguhz/VisionEncoder
The repo is organized into three top-level folders.
— current (V9.x) reproduction data (~6.5G)
Artefacts du modèle
1 artefact ckpts/S0/qwen3_5_2b/v10_2/step000348/mp_rank_00_model_states.pt
pt · 596 MB · SHA-256 a7f86a4a9fb1…35b5 · Hugging Face
Télécharger Extraits de sources
3 extraits C Classe
data/
Path Content data/vmllm_cached/qwen3vit/S2 cached_dataset arrow (image/video, 10pct + full); fed directly to stage-2 data/ms-swift-data/sampled sharegpt jsonl (10pct + full) data/llava_video/V9 decode-probed good_manifest for the video path
ckpts/ — ready-made 4B MLLM inference weightsPath Content ckpts/4b_stock4B stock baseline (raw Qwen3.5 ViT, skips declip), checkpoint-505, 9.5G ckpts/4b_v9_14B V9.1 (V-JEPA 2.1 video self-distill), checkpoint-505, 9.5G
Download either and feed it straight to evaluation (see the GitHub README, section 4 — MLLM evaluation) to skip declip + S1 + S2.
legacy/ — historical assets (~368G)Early-line products, not needed to reproduce the current main line: declip_siglip2/spatial_align, kd_mllm, self_refine, video_mllm_swift (old SigLIP2 / image-only S1+S2 ckpts), and old ViT-family arrow caches.
Download # current dev data
huggingface-cli download xiaomoguhzz/VisionEncoder --include "data/*" --local-dir .
# ready-made 4B MLLM ckpt (eval directly)
huggingface-cli download xiaomoguhzz/VisionEncoder --include "ckpts/4b_v9_1/*" --local-dir .
Related 11 juil.
---
license: apache-2.0
library_name: transformers
tags:
- vision-encoder
- distillation
- video-language
- siglip2
- dinov3
---
# VisionEncoder
Hosted artifacts (derived data + trained checkpoints) for the **VisionEncoder** research project.
**Training code + full reproduction guide**: https://github.com/xiaomoguhz/VisionEncoder
The repo is organized into three top-level folders.
## `data/` — current (V9.x) reproduction data (~6.5G)
| Path | Content |
|---|---|
| `data/vmllm_cached/qwen3vit/` | S2 `cached_dataset` arrow (image/video, 10pct + full); fed directly to stage-2 |
| `data/ms-swift-data/` | sampled sharegpt jsonl (10pct + full) |
| `data/llava_video/` | V9 decode-probed `good_manifest` for the video path |
## `ckpts/` — ready-made 4B MLLM inference weights
| Path | Content |
|---|---|
| `ckpts/4b_stock` | 4B stock baseline (raw Qwen3.5 ViT, skips declip), checkpoint-505, 9.5G |
| `ckpts/4b_v9_1` | 4B V9.1 (V-JEPA 2.1 video self-distill), checkpoint-505, 9.5G |
Download either and feed it straight to evaluation (see the GitHub README, section 4 — MLLM evaluation) to skip declip + S1 + S2.
## `legacy/` — historical assets (~368G)
Early-line products, not needed to reproduce the current main line: `declip_siglip2/spatial_align`, `kd_mllm`, `self_refine`, `video_mllm_swift` (old SigLIP2 / image-only S1+S2 ckpts), and old ViT-family arrow caches.
## Download
```bash
# current dev data
huggingface-cli download xiaomoguhzz/VisionEncoder --include "data/*" --local-dir .
# ready-made 4B MLLM ckpt (eval directly)
huggingface-cli download xiaomoguhzz/VisionEncoder --include "ckpts/4b_v9_1/*" --local-dir .
```
## Related
- Code + reproduction guide: https://github.com/xiaomoguhz/VisionEncoder
Source context: 0 downloads · 0 likes · Library transformers · Repo xiaomoguhzz/VisionEncoder
Source context: 0 downloads · 0 likes · Library transformers · Repo xiaomoguhzz/VisionEncoder