Últimamente paso bastante tiempo viendo trabajar a Codex.
Cuando preparo prompts para construir cosas en Work/Codex, algunas tareas pueden durar veinte minutos, pero otras se extienden durante horas. Mientras tanto, sigo trabajando y de vez en cuando regreso para revisar qué está haciendo.
Fue así como comencé a prestarle más atención a la mascota animada que aparece mientras Codex trabaja en background. Al principio puede parecer simplemente decorativa, pero mientras esperaba fui entendiendo mejor su función: me ayuda a saber que Codex sigue trabajando y me va mostrando qué está haciendo.
Entonces encontré un botón bastante inocente que decía Create.
Mi reacción fue inmediata:
“¡Genial!”
La opción me decía que podía crear una mascota de acuerdo con lo que ChatGPT conocía sobre mí.
Esperaba algo sencillo. Quizá unos minutos de trabajo.
No fue exactamente así.
Codex comenzó a trabajar incansablemente y terminó después de 1 hora, 37 minutos y 10 segundos, consumiendo alrededor del 10% del uso disponible que estaba siguiendo en mi Premium seat de ChatGPT Business.
Eso definitivamente no me lo esperaba.
Creía que había presionado un botón para hacer algo relativamente simple y terminé viendo a Codex trabajar durante más de hora y media.
Pero al final apareció un simpático armadillo.
Su nombre terminó siendo Cota.
Y quiero ser justo con el resultado: no creo que haya sido malo. Todo lo contrario. Había presionado un botón y la IA había hecho prácticamente todo el trabajo.
Pero para ese momento yo ya tenía algo más de experiencia construyendo mi página web y estaba en medio de la construcción de mi propio CRM.
Y esas experiencias me habían llevado a pensar que debía ser más riguroso antes de dejar que Codex comenzara a construir.
¿Qué pasaría si refinaba el prompt antes de llegar a Codex?
Para la segunda mascota decidí probar algo diferente.
En lugar de comenzar directamente en Codex, invertí primero tiempo en desarrollar el prototipo en ChatGPT, utilizando GPT-5.6 Sol con el nivel de razonamiento “Muy alta”, que era la configuración que estaba usando en ese momento.
Ahí podía permitirme muchas más iteraciones antes de llevar el trabajo a Codex.
Fui trabajando el concepto, revisando alternativas y haciendo cambios hasta que finalmente me sentí satisfecho con el prototipo.
Entonces preparé el prompt.
Pero todavía no lo envié a Codex.
Esta vez decidí pasarlo primero por Claude, utilizando Claude Sonnet 5 como una especie de QA —control de calidad— del prompt.
Pensaba que quizá encontraría algunos detalles menores.
Para mi sorpresa, terminé haciendo tres iteraciones entre ChatGPT y Claude.
Y no fueron únicamente cambios cosméticos.
En cada nueva revisión aparecieron observaciones suficientemente significativas como para regresar a ChatGPT, modificar el prompt y, en algunos casos, cambiar también el prototipo.
Claude encontraba algo.
Yo evaluaba si la observación tenía sentido.
Regresaba a ChatGPT.
Hacíamos los ajustes.
Preparaba una nueva versión.
Y volvía a pasarla por QA.
Después de tres ciclos llegué finalmente a una versión que había pasado las revisiones que estaba utilizando para evaluar el prompt.
Ahora sí.
Navi estaba lista para Codex.
¿Todo ese refinamiento serviría para algo?
En este punto tenía otra inquietud.
Había invertido considerablemente más esfuerzo antes de comenzar la ejecución.
Entonces quería saber si ese proceso de refinamiento también tendría algún efecto en el tiempo o en el uso de mi Premium seat cuando Codex comenzara a trabajar.
Solo había una manera de saberlo.
Ejecuté el prompt.
Después de 1 hora, 55 minutos y 21 segundos, y utilizando aproximadamente 8% del uso disponible que estaba siguiendo, Navi estaba operacional.
Cuando puse los dos resultados uno al lado del otro, esto es lo que había ocurrido.
Cota
El proceso previo había sido prácticamente automático: presionar Create y dejar que Codex trabajara.
No hubo iteraciones previas entre ChatGPT y Claude.
El tiempo de ejecución observado fue de 1 hora, 37 minutos y 10 segundos, con un uso aproximado del 10% de la capacidad que estaba siguiendo.
Navi
El proceso fue diferente.
Antes de llegar a Codex hubo desarrollo del prototipo, refinamiento del prompt y tres iteraciones de QA entre ChatGPT y Claude.
Después de todo ese trabajo previo, el tiempo de ejecución observado en Codex fue de 1 hora, 55 minutos y 21 segundos, con un uso aproximado del 8%.
A primera vista aparece algo interesante.
Navi utilizó aproximadamente dos puntos porcentuales menos del uso que estaba siguiendo, aunque Codex tardó alrededor de 18 minutos más en terminar.
Pero aquí tengo que ser cuidadoso.
Esto no fue un experimento controlado.
Las dos mascotas no eran iguales, los requerimientos tampoco y el proceso previo fue completamente diferente.
Además, para crear Navi invertí tiempo que no aparece en esas 1 hora y 55 minutos: las conversaciones con ChatGPT, las revisiones de Claude, mis propias decisiones y tres ciclos de modificación del prototipo y del prompt.
Por eso no me atrevo a concluir que refinar un prompt de esta manera hará que cualquier construcción en Work/Codex consuma menos recursos o sea más rápida.
Tengo solamente dos ejecuciones y demasiadas variables.
Lo que sí puedo decir es lo que ocurrió en este caso: la segunda ejecución consumió menos del uso que estaba siguiendo, tardó más tiempo en Codex y produjo un resultado con el que me siento más identificado.
Y eso último terminó siendo más importante de lo que esperaba.
¿Por qué me gusta más Navi?
Me siento más contento con Navi que con Cota.
Pero tengo que reconocer que eso es completamente subjetivo.
Puede que alguien vea las dos mascotas y prefiera a Cota.
Y quizá parte de mi preferencia por Navi venga precisamente del proceso.
Con Cota presioné un botón y esperé.
Con Navi tuve que decidir.
Vi alternativas, descarté algunas, acepté otras, recibí observaciones, regresé al diseño, hice cambios y repetí el proceso varias veces.
De alguna manera fui viendo cómo Navi se construía antes de que Codex comenzara a construirla.
Eso hace que me identifique más con el resultado.
Y ahí apareció una lección que no estaba buscando cuando presioné aquel botón Create.
Una IA revisando el trabajo de otra IA
El otro aprendizaje importante fue el proceso de QA entre ChatGPT y Claude.
Esta experiencia, junto con otros trabajos que estoy realizando, me ha llevado incluso a mantener también una licencia de pago de Claude.
Como el uso disponible que tengo allí es más restrictivo, he comenzado a utilizarlo con más cuidado.
No intento hacer todo dos veces.
Lo utilizo de manera más específica, por ejemplo, como una segunda mirada para revisar prompts importantes antes de enviarlos a Codex.
Y este proceso ya me ha permitido encontrar observaciones que no había conseguido identificar trabajando solamente con ChatGPT.
Pero también he aprendido algo importante.
No se trata simplemente de copiar lo que produce una IA, pegarlo en otra y automatizar la conversación entre ambas.
Si hago eso, lo único que estoy creando es una cadena más larga de automatización.
En mi caso, el valor aparece precisamente en lo que ocurre entre una IA y la otra.
Claude encuentra una observación.
Yo decido si tiene sentido.
Regreso a ChatGPT.
Cambio el prompt.
A veces cambio también el prototipo.
Y vuelvo a revisar.
Las IA participan en el proceso de calidad, pero yo sigo siendo parte del proceso.
Dos formas diferentes de trabajar con IA
Al final, las dos mascotas terminaron representando dos maneras bastante distintas de trabajar.
Con Cota experimenté lo que puede hacer la IA cuando prácticamente le digo:
hazlo por mí.
Con Navi experimenté algo diferente:
ayúdame a construirlo, cuestionarlo y refinarlo antes de ejecutarlo.
Las dos formas pueden producir resultados útiles.
Y no creo que una invalide automáticamente a la otra.
Hay cosas para las que probablemente seguiré prefiriendo presionar un botón y aceptar un buen resultado sin invertir demasiado tiempo.
Pero cuando el resultado importa más —como está ocurriendo con mi página web, mi CRM y otros proyectos que estoy construyendo— estoy aprendiendo a invertir más esfuerzo antes de enviar una tarea larga a Codex.
No solamente porque quizá pueda utilizar mejor los recursos disponibles.
También porque llego a la ejecución entendiendo mucho mejor qué quiero construir.
Y hay una última diferencia que para mí terminó siendo evidente.
Cota fue algo que la IA creó para mí.
Navi se siente como algo que construí con la IA.
Quizá esa sea la lección que más me llevo de este pequeño experimento.
