Saltar a contenido

Fuentes

Principio de arquitectura

No cablear fuentes en código. Existe una tabla fuentes en Postgres y un solo bucle genérico de ingesta. Agregar una fuente es insertar una fila y escribir un normalizador, no editar el orquestador.

Ver Modelo de datos.

Estado de las fuentes

Fuente Carril Auth Fragilidad Fase Estado
Banco Mundial — procnotices A, C Ninguna Baja 1 Verificado
BID — CKAN A, B, C Ninguna Baja 1 Verificado
TED A, C Ninguna Media 1 Verificado
Banco Mundial — projects + wds B Ninguna Baja 4 Verificado
WMO Radar Database B Ninguna Media 3 Verificado
OMM / AR IV B Ninguna Alta 4 Parcial
SAM.gov A, C API key Baja 6 Verificado
IATI Datastore B API key Baja 6 Verificado
UNGM A Ver página Alta 6 Riesgo legal
Portales nacionales OCDS A, B Varía Varía 6 Sin verificar

Capas por calidad de acceso

Capa A — APIs estructuradas. Alta precisión, bajo ruido, contrato estable. Todo lo que se pueda obtener acá se obtiene acá.

Capa B — Sin API oficial. Endpoints internos, scraping, feeds RSS. Frágiles por definición. Requieren monitoreo de salud y revisión de términos de uso.

Capa C — Búsqueda web genérica. Residual, para lo que no está en ningún portal: noticias de adjudicación, anuncios de servicios meteorológicos, notas de prensa. Nunca es el punto de partida.

Por qué la búsqueda web no es el primer eslabón

Los portales de licitación no se indexan bien: sirven resultados vía POST o JavaScript. Google los ve tarde, parcialmente o nunca. Un aviso con ventana de 14 días puede aparecer en el índice cuando ya no sirve. Además, sin ID nativo de la fuente no hay deduplicación posible.

Plantilla para documentar una fuente nueva

Cada página de fuente lleva, como mínimo:

  • Endpoint exacto y versión
  • Autenticación y cuotas, con números
  • Campos que consumimos y a qué campo del contrato mapean
  • Modo de fallo conocido y cómo se detecta
  • Carril al que alimenta y fase en que entra
  • Términos de uso y licencia de los datos