📘 EDICO — Guía de usuario
Eliz & Delia's Image Captioner and Organizer — guía paso a paso para crear un dataset de personaje limpio y con captions de IA para el entrenamiento de LoRAs, todo desde tu navegador.
EDICO es una herramienta local y de código abierto que convierte una carpeta de imágenes de personaje en un dataset de captions estructurado y consistente. Todo corre en tu máquina a través de Ollama — tus imágenes nunca salen de tu computadora.
⚙️ Antes de empezar
- Windows con PowerShell 5.1 o 7+.
- Ollama instalado y en ejecución (ollama.com/download).
- Un modelo de visión descargado, por ejemplo:
ollama pull huihui_ai/qwen3-vl-abliterated:8b-instruct. - Imágenes en
.png,.jpg,.jpego.webp.
🚀 Inicio rápido
1. Descarga los archivos de la versión (dataset_tool.ps1 + start.bat) desde GitHub.
2. Haz doble clic en start.bat — aparece una ventana de terminal y tu navegador abre EDICO automáticamente.
3. Mantén abierta la ventana de terminal mientras trabajas — es el servidor. Ciérrala con Ctrl+C cuando termines.
El botón de documentación (arriba a la derecha) siempre enlaza de vuelta a este sitio.
🧭 El flujo de 7 pasos
Welcome
Paso 1Mira todos tus proyectos con su número de imágenes y estado. Abre uno existente o pulsa + New project.
Vision Model
Paso 2EDICO detecta tus modelos de Ollama y marca los de visión con la insignia [VL]. También puedes descargar un modelo nuevo desde el mismo campo.
Identity
Paso 3Define tu trigger word única y los rasgos fijos del personaje (cabello, ojos, complexión…). Se añaden automáticamente al inicio de cada caption.
Images
Paso 4Arrastra y suelta una carpeta sobre la zona, o haz clic para explorar. Revisa las miniaturas, elimina imágenes individuales o bórralas todas antes de continuar.
Categories
Paso 5Edita el vocabulario de captions: añade o quita términos por categoría, restablece los valores por defecto y despliega Advanced: System Instruction para ajustar las reglas de la IA.
Pipeline
Paso 6Sigue el progreso en vivo en una cuadrícula de miniaturas mientras se capta cada imagen. Puedes cancelar y luego resumir — las imágenes terminadas siempre se saltan.
Organizer
Paso 7La sala de revisión final: filtra, edita, reordena, añade y gestiona tu dataset terminado.
📂 Dónde viven tus archivos
Cada proyecto tiene su propia carpeta, con el nombre de tu trigger word:
TuTrigger/
├── config.json # ajustes, categorías, instrucción
├── source/ # tus originales (nunca se modifican)
└── working/ # copias numeradas + captions .txt🔎 Consejo: con un proyecto abierto, pulsa Open files junto a la barra de pasos para ir directo a la carpeta /working en el Explorador de Windows — ideal para tomar el dataset final para tu entrenador (Kohya, OneTrainer, etc.).
🛠️ Dominando el Organizer
Filters
Filtra por cualquier categoría — pose, expresión, framing… Cada filtro muestra conteos en vivo, además de una píldora unspec (discontinua, en cursiva) para las imágenes sin ese atributo. Activa Multi-select para combinar filtros, o cambia a selección única para aislar un término.
Editor estructurado
Pulsa Edit en cualquier tarjeta. Verás la imagen y el caption completo, y podrás elegir un término por categoría en los acordeones — sin editar texto plano. Los campos libres gestionan Clothing y Accessories, e incluso puedes añadir un término nuevo a una categoría sobre la marcha.
Add images
Añade una imagen más tarde: suéltala, describe clothing y accessories, elige términos y guarda. EDICO almacena el original en source/ y crea una copia numerada en working/ — incluso si dos archivos comparten nombre.
Rearrange & Re-sequence
Arrastra las tarjetas para fijar tu orden preferido, o usa Auto-arrange para ordenar por hasta tres prioridades (p. ej. primero close-ups, luego front views). Run sequencer renombra las imágenes y sus captions correspondientes a 001…N.
Insignias en cada tarjeta
Cada miniatura muestra su formato y resolución. Verde = tamaño estándar (512, 768 o 1024 en cuadrado). Rojo = no estándar — conviene revisarla. La insignia DUP señala captions casi idénticos que podrían ser poses duplicadas.
Lightbox
Haz clic en cualquier imagen para una vista grande con insignias, flechas para navegar y botones rápidos de Edit / Del ahí mismo.
🩹 Solución de problemas
- ¿No aparecen modelos? Asegúrate de que Ollama esté en ejecución (
ollama listen una terminal). - ¿Los captions fallan o se quedan colgados? Verifica que el modelo sea de visión y que Ollama responda. EDICO reintenta cada imagen hasta 3 veces y registra los errores en
_pipeline_log.txt. - ¿Se interrumpió a mitad? Reabre el proyecto — EDICO mostrará "N of M already captioned" y ofrecerá Resume.
- ¿La galería se ve rara? Pulsa Reset filters — un filtro antiguo puede estar ocultando imágenes.
- ¿Puerto ocupado? Cierra otras instancias de EDICO; elige automáticamente el siguiente puerto libre.
🧪 EDICO — Recomendaciones de dataset
Consejos prácticos para crear un dataset de entrenamiento del que tu LoRA te lo agradecerá — desde la cantidad de imágenes hasta el diseño del vocabulario.
La calidad de tu LoRA se decide antes del entrenamiento — en las imágenes que recopilas y los captions que escribes. Estas recomendaciones recorren cada paso de EDICO con los números y las reglas prácticas que funcionan.
🧠 Paso 2 — Usa un modelo de visión en el que confíes
- Elige un modelo marcado con [VL] — así señala EDICO que es capaz de visión.
- Recomendado:
huihui_ai/qwen3-vl-abliterated:8b-instruct— gran detalle y buen seguimiento de instrucciones. - ¿Hardware limitado?
huihui_ai/qwen2.5-vl-abliterated:7bo una variante 4b son más rápidos con algo menos de matiz. - La constancia vence a la astucia — sea cual sea tu elección, termina todo el dataset con el mismo modelo para que el lenguaje sea uniforme.
🪪 Paso 3 — Haz memorable tu trigger word
- Usa un token único y poco común — evita nombres reales o palabras sueltas ya habituales en los captions (p. ej. "girl"). Una etiqueta ficticia como
Delia450K2es mucho más fácil de tratar como un solo concepto. - Mantén la consistencia — misma ortografía, mismo formato, en cada imagen y cada caption.
- Escribe una base identity rica y fija — cabello, ojos, complexión, tono de piel. Como se antepone automáticamente, cada caption lleva la descripción completa del personaje.
🖼️ Paso 4 — Selecciona tus imágenes antes de captar
- Busca 50–200+ imágenes buenas. Para un solo personaje, ~100 es un excelente punto de partida; más ayuda con ángulos o atuendos poco frecuentes.
- Prefiere resoluciones cuadradas estándar — 512×512, 768×768 o 1024×1024. EDICO marca en rojo los tamaños no estándar en cada tarjeta.
- Busca variedad a propósito:
- poses (standing, sitting, dinámicas…)
- encuadres (close-up, half body, full body…)
- miradas, expresiones y ángulos de cámara
- iluminación y fondos (studio, daylight, indoors…)
- Mantén el rostro claramente visible en la mayoría de las imágenes — es lo que tu LoRA debe aprender con más esfuerzo.
- Descarta duplicados y casi-duplicados antes de empezar. La insignia DUP de EDICO te ayuda a detectar captions gemelos.
- Elimina marcas de agua, texto superpuesto y recortes extremos — el modelo los tratará como rasgos de tu personaje.
🏷️ Paso 5 — Diseña el vocabulario como un diseñador
- Equilibra las categorías — mantén pose, framing, viewpoint, lighting y background como términos genuinamente distintos para que cada caption describa uno de cada.
- Evita términos solapados entre categorías ("sitting" en Pose y "sitting on chair" en otra confundirá la asignación). Las píldoras de filtro hacen visibles los solapamientos.
- Mantén los términos cortos y consistentes — "looking at camera", no "gazing toward lens". La IA reproduce lo que le enseñas.
- Clothing y accessories son texto libre porque los atuendos son infinitos — pero mantén el estilo de redacción paralelo al de los términos de categoría.
- Prueba primero un lote pequeño — capta 5–10 imágenes, revísalas en el Organizer y ajusta el vocabulario antes de lanzar el set completo.
🏷️ La anatomía de un buen caption
Objetivo: un caption que sea consistente, completo y limpio en palabras clave para entrenar:
trigger, fixed identity,
clothing, accessories,
pose, head, gaze,
expression, framing,
viewpoint, lighting,
backgroundEjemplo:
Delia450K2, woman, adult,
light olive skin, brown eyes,
toned build, short dark hair,
floral top, necklace,
standing, head upright,
looking at camera, smiling,
half body, front view,
soft daylight, cityscapeObserva: cada atributo variable aparece exactamente una vez.
⚠️ Qué evitar
- Relleno de calidad — "masterpiece", "8k", "photorealistic". Estos enseñan a la LoRA a perseguir estilos, no a tu personaje.
- Artículos y frases completas — "a woman wearing a jacket" añade ruido. El estilo de palabras clave es más limpio.
- Suposiciones emocionales — describe la expresión visible, nunca sentimientos internos.
- Deriva de identidad — si el cabello del mismo personaje cambia de color entre imágenes, tu LoRA no sabrá cuál aprender.
- Idiomas mezclados — mantén los captions en un solo idioma en todo el conjunto.
🧹 Pasada final en el Organizer
- Revisa las insignias rojas de resolución — vuelve a exportar o descarta los tamaños no estándar.
- Repasa las insignias DUP — confirma que son variedad intencional, no duplicados.
- Filtra por unspec en cada categoría — son las imágenes que la IA no pudo clasificar; corrígelas a mano en el editor.
- Reordena deliberadamente — agrupa los close-ups primero o por atuendo — y luego ejecuta el secuenciador para que tu carpeta final quede limpia y numerada.
- Toma la carpeta con el botón Open files —
/workingahora contiene tus pares.png/.txtnumerados, listos para tu entrenador (Kohya, OneTrainer, etc.).
⚖️ Licencia MIT © 2026 Gabriel Solis · Los grandes datasets hacen grandes LoRAs.
