Qué resolvemos ·¿Dónde meto el presupuesto?

Vanguard · Guiar

¿Cuánto cuesta de verdad su IA según dónde corra?

Arriba quieren traerla a casa y yo voy a tener que operar lo que decidan.

Su punto de equilibrio calculado con sus volúmenes y el modo de falla que asume si decide autoalojar.

Agendar la conversación25 minutos. Una sola pregunta al reservar.

Dónde Corre la InferenciaEnviar esta página a quien decide

Le suena si

  • Hay presión por traer la inferencia a casa, por seguridad o por costo.
  • Hay una propuesta de compra de equipo cuyo punto de equilibrio no está calculado.
  • La factura de consumo crece y el gasto no está atribuido por caso de uso.
Quién entrega
El fundador, en todos los encargos.
Cómo se contrata
Precio fijo, con criterio de aceptación escrito antes de empezar.
Plazo y precio
Fijos, por escrito, después de valorar su caso en la conversación de 25 minutos.

Para usar hoy, sin contratar nada

La cuenta de servilleta, que desmonta o confirma la decisión en veinte minutos y la puede hacer usted hoy.

  1. Saque su consumo diario en tokens, las unidades de texto con que le factura el proveedor. El diario, no el mensual promedio. Del pico, no de la media: el hardware se dimensiona para el pico y ahí está el error del cálculo típico.
  2. Multiplíquelo por el precio por millón de la API que usa hoy y anualice. Ese es su piso de comparación.
  3. Al costo del hardware propio súmele las tres cosas que se quedan fuera: la energía y el espacio, la amortización a tres años y el tiempo de la persona que lo va a operar. Esa tercera es la que cambia el resultado.
  4. Compare y desconfíe si le da parecido. A volúmenes moderados, autoalojar sale más caro. Si le da barato, revise si contó la operación.

Y la parte que no es una cuenta: si autoaloja, hereda el modo de falla completo: alineamiento, parcheo, monitoreo de abuso, respuesta a incidentes y versionado. Escriba al lado de cada uno quién lo haría en su organización. Los que se queden sin nombre son el verdadero costo de la decisión.

Cómo lo resolvemos

El método, no la promesa.

  1. Se mide el consumo real, en picos y no en promedios, porque el hardware se dimensiona para el pico.
  2. Se modelan los tres modos con la operación adentro: servicio de un proveedor de frontera, servicio sobre modelos de pesos abiertos y alojamiento propio.
  3. Se calcula el punto de equilibrio suyo, con sensibilidad sobre los dos o tres supuestos que lo mueven.
  4. Se inventaría el modo de falla que se transfiere y se le pone nombre de responsable a cada elemento.
  5. Se escribe la recomendación con la condición que la cambiaría, para que sirva también dentro de un año.

Qué recibe

  • La medición de su consumo real y proyectado, en picos.
  • El modelo de costo comparado en los tres modos, editable y con supuestos abiertos.
  • El punto de equilibrio con su análisis de sensibilidad.
  • El inventario del modo de falla transferido, con responsable y costo de plantilla.

La prueba que viene al caso

  • Dirección de operaciones e infraestructura de 60.000 servidores, con el costo y la capacidad como responsabilidad propia.
  • Programa de eliminación de licencias por más de 100 millones de dólares anuales.
  • 19 años vendiendo infraestructura desde HPE e IBM y comprándola desde Citi.

Antes de contratar

La seguridad de la cadena de suministro de modelos se señala como advertencia en el informe y se remite a un especialista en esa disciplina.

Autoalojar puede ahorrar o no; la respuesta sale de la aritmética con sus volúmenes. Lo que importa es que quien la haga haya operado infraestructura propia y sepa qué cuesta de verdad mantenerla encendida un año entero.

Si autoaloja, ¿quién parchea, quién monitorea el abuso y quién responde un domingo?