📘 EDICO — Guía de usuario

Eliz & Delia's Image Captioner and Organizer — guía paso a paso para crear un dataset de personaje limpio y con captions de IA para el entrenamiento de LoRAs, todo desde tu navegador.

EDICO es una herramienta local y de código abierto que convierte una carpeta de imágenes de personaje en un dataset de captions estructurado y consistente. Todo corre en tu máquina a través de Ollama — tus imágenes nunca salen de tu computadora.

⚙️ Antes de empezar

  • Windows con PowerShell 5.1 o 7+.
  • Ollama instalado y en ejecución (ollama.com/download).
  • Un modelo de visión descargado, por ejemplo: ollama pull huihui_ai/qwen3-vl-abliterated:8b-instruct.
  • Imágenes en .png, .jpg, .jpeg o .webp.

🚀 Inicio rápido

1. Descarga los archivos de la versión (dataset_tool.ps1 + start.bat) desde GitHub.

2. Haz doble clic en start.bat — aparece una ventana de terminal y tu navegador abre EDICO automáticamente.

3. Mantén abierta la ventana de terminal mientras trabajas — es el servidor. Ciérrala con Ctrl+C cuando termines.

El botón de documentación (arriba a la derecha) siempre enlaza de vuelta a este sitio.

🧭 El flujo de 7 pasos

👋

Welcome

Paso 1

Mira todos tus proyectos con su número de imágenes y estado. Abre uno existente o pulsa + New project.

🧠

Vision Model

Paso 2

EDICO detecta tus modelos de Ollama y marca los de visión con la insignia [VL]. También puedes descargar un modelo nuevo desde el mismo campo.

🪪

Identity

Paso 3

Define tu trigger word única y los rasgos fijos del personaje (cabello, ojos, complexión…). Se añaden automáticamente al inicio de cada caption.

🖼️

Images

Paso 4

Arrastra y suelta una carpeta sobre la zona, o haz clic para explorar. Revisa las miniaturas, elimina imágenes individuales o bórralas todas antes de continuar.

🏷️

Categories

Paso 5

Edita el vocabulario de captions: añade o quita términos por categoría, restablece los valores por defecto y despliega Advanced: System Instruction para ajustar las reglas de la IA.

Pipeline

Paso 6

Sigue el progreso en vivo en una cuadrícula de miniaturas mientras se capta cada imagen. Puedes cancelar y luego resumir — las imágenes terminadas siempre se saltan.

🗂️

Organizer

Paso 7

La sala de revisión final: filtra, edita, reordena, añade y gestiona tu dataset terminado.

📂 Dónde viven tus archivos

Cada proyecto tiene su propia carpeta, con el nombre de tu trigger word:

TuTrigger/
├── config.json   # ajustes, categorías, instrucción
├── source/        # tus originales (nunca se modifican)
└── working/       # copias numeradas + captions .txt

🔎 Consejo: con un proyecto abierto, pulsa Open files junto a la barra de pasos para ir directo a la carpeta /working en el Explorador de Windows — ideal para tomar el dataset final para tu entrenador (Kohya, OneTrainer, etc.).

🛠️ Dominando el Organizer

🎛️

Filters

Filtra por cualquier categoría — pose, expresión, framing… Cada filtro muestra conteos en vivo, además de una píldora unspec (discontinua, en cursiva) para las imágenes sin ese atributo. Activa Multi-select para combinar filtros, o cambia a selección única para aislar un término.

✏️

Editor estructurado

Pulsa Edit en cualquier tarjeta. Verás la imagen y el caption completo, y podrás elegir un término por categoría en los acordeones — sin editar texto plano. Los campos libres gestionan Clothing y Accessories, e incluso puedes añadir un término nuevo a una categoría sobre la marcha.

Add images

Añade una imagen más tarde: suéltala, describe clothing y accessories, elige términos y guarda. EDICO almacena el original en source/ y crea una copia numerada en working/ — incluso si dos archivos comparten nombre.

🔀

Rearrange & Re-sequence

Arrastra las tarjetas para fijar tu orden preferido, o usa Auto-arrange para ordenar por hasta tres prioridades (p. ej. primero close-ups, luego front views). Run sequencer renombra las imágenes y sus captions correspondientes a 001…N.

🏷️

Insignias en cada tarjeta

Cada miniatura muestra su formato y resolución. Verde = tamaño estándar (512, 768 o 1024 en cuadrado). Rojo = no estándar — conviene revisarla. La insignia DUP señala captions casi idénticos que podrían ser poses duplicadas.

🔍

Lightbox

Haz clic en cualquier imagen para una vista grande con insignias, flechas para navegar y botones rápidos de Edit / Del ahí mismo.

🩹 Solución de problemas

  • ¿No aparecen modelos? Asegúrate de que Ollama esté en ejecución (ollama list en una terminal).
  • ¿Los captions fallan o se quedan colgados? Verifica que el modelo sea de visión y que Ollama responda. EDICO reintenta cada imagen hasta 3 veces y registra los errores en _pipeline_log.txt.
  • ¿Se interrumpió a mitad? Reabre el proyecto — EDICO mostrará "N of M already captioned" y ofrecerá Resume.
  • ¿La galería se ve rara? Pulsa Reset filters — un filtro antiguo puede estar ocultando imágenes.
  • ¿Puerto ocupado? Cierra otras instancias de EDICO; elige automáticamente el siguiente puerto libre.

🧪 EDICO — Recomendaciones de dataset

Consejos prácticos para crear un dataset de entrenamiento del que tu LoRA te lo agradecerá — desde la cantidad de imágenes hasta el diseño del vocabulario.

La calidad de tu LoRA se decide antes del entrenamiento — en las imágenes que recopilas y los captions que escribes. Estas recomendaciones recorren cada paso de EDICO con los números y las reglas prácticas que funcionan.

🧠 Paso 2 — Usa un modelo de visión en el que confíes

  • Elige un modelo marcado con [VL] — así señala EDICO que es capaz de visión.
  • Recomendado: huihui_ai/qwen3-vl-abliterated:8b-instruct — gran detalle y buen seguimiento de instrucciones.
  • ¿Hardware limitado? huihui_ai/qwen2.5-vl-abliterated:7b o una variante 4b son más rápidos con algo menos de matiz.
  • La constancia vence a la astucia — sea cual sea tu elección, termina todo el dataset con el mismo modelo para que el lenguaje sea uniforme.

🪪 Paso 3 — Haz memorable tu trigger word

  • Usa un token único y poco común — evita nombres reales o palabras sueltas ya habituales en los captions (p. ej. "girl"). Una etiqueta ficticia como Delia450K2 es mucho más fácil de tratar como un solo concepto.
  • Mantén la consistencia — misma ortografía, mismo formato, en cada imagen y cada caption.
  • Escribe una base identity rica y fija — cabello, ojos, complexión, tono de piel. Como se antepone automáticamente, cada caption lleva la descripción completa del personaje.

🖼️ Paso 4 — Selecciona tus imágenes antes de captar

  • Busca 50–200+ imágenes buenas. Para un solo personaje, ~100 es un excelente punto de partida; más ayuda con ángulos o atuendos poco frecuentes.
  • Prefiere resoluciones cuadradas estándar — 512×512, 768×768 o 1024×1024. EDICO marca en rojo los tamaños no estándar en cada tarjeta.
  • Busca variedad a propósito:
    • poses (standing, sitting, dinámicas…)
    • encuadres (close-up, half body, full body…)
    • miradas, expresiones y ángulos de cámara
    • iluminación y fondos (studio, daylight, indoors…)
  • Mantén el rostro claramente visible en la mayoría de las imágenes — es lo que tu LoRA debe aprender con más esfuerzo.
  • Descarta duplicados y casi-duplicados antes de empezar. La insignia DUP de EDICO te ayuda a detectar captions gemelos.
  • Elimina marcas de agua, texto superpuesto y recortes extremos — el modelo los tratará como rasgos de tu personaje.

🏷️ Paso 5 — Diseña el vocabulario como un diseñador

  • Equilibra las categorías — mantén pose, framing, viewpoint, lighting y background como términos genuinamente distintos para que cada caption describa uno de cada.
  • Evita términos solapados entre categorías ("sitting" en Pose y "sitting on chair" en otra confundirá la asignación). Las píldoras de filtro hacen visibles los solapamientos.
  • Mantén los términos cortos y consistentes — "looking at camera", no "gazing toward lens". La IA reproduce lo que le enseñas.
  • Clothing y accessories son texto libre porque los atuendos son infinitos — pero mantén el estilo de redacción paralelo al de los términos de categoría.
  • Prueba primero un lote pequeño — capta 5–10 imágenes, revísalas en el Organizer y ajusta el vocabulario antes de lanzar el set completo.

🏷️ La anatomía de un buen caption

Objetivo: un caption que sea consistente, completo y limpio en palabras clave para entrenar:

trigger, fixed identity,
clothing, accessories,
pose, head, gaze,
expression, framing,
viewpoint, lighting,
background

Ejemplo:

Delia450K2, woman, adult,
light olive skin, brown eyes,
toned build, short dark hair,
floral top, necklace,
standing, head upright,
looking at camera, smiling,
half body, front view,
soft daylight, cityscape

Observa: cada atributo variable aparece exactamente una vez.

⚠️ Qué evitar

  • Relleno de calidad — "masterpiece", "8k", "photorealistic". Estos enseñan a la LoRA a perseguir estilos, no a tu personaje.
  • Artículos y frases completas — "a woman wearing a jacket" añade ruido. El estilo de palabras clave es más limpio.
  • Suposiciones emocionales — describe la expresión visible, nunca sentimientos internos.
  • Deriva de identidad — si el cabello del mismo personaje cambia de color entre imágenes, tu LoRA no sabrá cuál aprender.
  • Idiomas mezclados — mantén los captions en un solo idioma en todo el conjunto.

🧹 Pasada final en el Organizer

  • Revisa las insignias rojas de resolución — vuelve a exportar o descarta los tamaños no estándar.
  • Repasa las insignias DUP — confirma que son variedad intencional, no duplicados.
  • Filtra por unspec en cada categoría — son las imágenes que la IA no pudo clasificar; corrígelas a mano en el editor.
  • Reordena deliberadamente — agrupa los close-ups primero o por atuendo — y luego ejecuta el secuenciador para que tu carpeta final quede limpia y numerada.
  • Toma la carpeta con el botón Open files/working ahora contiene tus pares .png/.txt numerados, listos para tu entrenador (Kohya, OneTrainer, etc.).

📚 Más recursos

Otras herramientas   🐙 GitHub

⚖️ Licencia MIT © 2026 Gabriel Solis · Los grandes datasets hacen grandes LoRAs.

Carrito de compra
Scroll al inicio