Vibe coding e IA generativa

Autonomía, datos sensibles y sostenibilidad en entornos de investigación

María Cristina Nanton

2026-07-09

Sobre mí

María Cristina Nanton

Desarrolladora
MinSal GCBA | The Global Health Network

Ciencia de datos en el sector público
Proyectos basados en datos en red global de investigación en salud

Vibe coding…

… vibe coding?

Hay un nuevo tipo de programación que llamo «vibe coding», donde te dejás llevar por completo por las vibras, abrazás las exponenciales y te olvidás de que el código siquiera existe. Es posible porque los LLM (p. ej. Cursor Composer con Sonnet) se están volviendo demasiado buenos. […]

Pido las cosas más tontas, como «reducí a la mitad el padding de la barra lateral», porque soy demasiado vago para buscarlo. Siempre le doy «Accept All», ya no leo los diffs. Cuando me aparecen mensajes de error, simplemente los copio y pego sin ningún comentario; normalmente eso lo arregla. […]

Estoy construyendo un proyecto o una webapp, pero no es realmente programar: solo veo cosas, digo cosas, ejecuto cosas y copio y pego cosas, y casi siempre funciona.

— Andrej Karpathy, Twitter, febrero de 2025 (traducción y énfasis propios)

1 - “Hicimos algo y funciona

IAs al alcance de todos

Plataformas de IA generativa que dan acceso a modelos de lenguaje avanzados


Claude - Anthropic
(Claude Opus 5, Sonnet 5, Fable 5.1)


ChatGPT - OpenAI
(GPT-5.5 Instant, GPT-5.6 Sol)


Copilot - Microsoft
(GPT-5.6, Claude Opus 5)

Interfaz conversacional + maneras específicas de integrarlas en proyectos basados en código
Claude Code | Codex | GitHub Copilot | Etc

IAs al alcance de todos

Y también modelos abiertos: descargables que se pueden correr en infraestructura propia (una notebook, un servidor del instituto, una nube ya aprobada)

Quién los publica

  • EE. UU.: Llama 4 (Meta) · Gemma 4 (Google) · gpt-oss (OpenAI)
  • Europa: Mistral Small 4 (Mistral AI)
  • China: Qwen 3.x (Alibaba) · DeepSeek V4 · GLM-5.1 (Z.ai) · Kimi K2 (Moonshot)

Qué hace falta para correrlos

  • Chicos: una notebook
  • De frontera: servidores con varias GPUs

Cómo se corren

  • En tu computadora o en un servidor

Qué se gana

  • Privacidad: el dato no viaja a un proveedor
  • Sin términos de servicio cambiantes
  • Costo previsible: hardware, no tokens

Si corre en infra propia, el dato no sale de la institución.

Plataformas: describís la app y aparece (hasta se publica!)

  • Un chat y una vista previa en vivo: describís lo que querés en lenguaje natural y la plataforma genera el frontend y, según cuál sea, también backend, base de datos y login, y lo publica con un clic
  • No hay nada que instalar ni programar: el resultado es un producto usable y accesible via URL pública
  • Ejemplos: Lovable | Base44 | Bolt.new | Replit |Claude (artifacts) | ….

¿Qué productos salen de ahí?

Productos como

  • Sitios institucionales y landings
  • Formularios con validación y login
  • Tableros y dashboards
  • Prototipos para mostrar a un comité o financiador

Algunos ejemplos que vi

  • Prototipo de publicación digital para organización académica
  • Sitio para la formación de estudiantes, con LLM integrado para responder preguntas
  • Herramienta para gestión de alumnos y proyectos de investigación

En resumen: autonomía y velocidad

  • Prototipos en días u horas
  • Iteraciones más rápidas
  • Menos (o nada de) intermediarios

Entre prototipo y producción (1/2)

Algunas preguntas que suelen presentarse:

  • ¿Cómo integro esto en la plataforma de mi institución?
  • ¿Cómo integro herramientas específicas: login institucional, calendarización, otras plataformas?
  • ¿Cómo lo pago cuando supero el plan gratuito o cambian los términos del servicio?

Entre prototipo y producción (2/2)

  • ¿Cómo sé que los datos que ingresan mis usuarios (o los que yo ingresé) están seguros?
  • ¿Qué tan difícil es levantar esto de cero en mi organización?

2 - Aprovechar la autonomía sin generar(nos) un problema

Trabajo con datos sensibles

Piso normativo

  • Por región: desde marcos muy detallados hasta contextos con regulación general pero sin guías específicas sobre IA
  • Institucional: puede existir o no
  • Que no haya una norma que lo prohíba explícitamente no lo hace seguro o ético

Trabajo con datos sensibles

Piso propio — tres preguntas antes de empezar

  • ¿Puedo reconstruir la identidad de una persona con los datos que utilizo?
  • ¿Quién va a acceder a los datos y en qué entorno?
  • ¿Hay expectativas sobre cómo se tratan?

Viejos problemas, amplificados: un Google Doc se queda donde lo dejaste; un prompt puede terminar en datos de entrenamiento, y una app generada con Lovable puede publicar la base de datos en internet.

Un ejemplo reciente (1/2): créditos de IA para investigar enfermedades raras

Anthropic, programa AI for Science — convocatoria temática (jul 2026)

  • Hasta USD 50.000 en créditos de Claude por seis meses; postulación hasta el 2 de agosto de 2026
  • Dos tracks: ciencia básica y biotechs en etapa temprana (dosis iniciales, biomarcadores, documentación regulatoria)
  • El argumento: ~400 millones de personas con alguna de más de 7.000 enfermedades raras; poblaciones chicas, datos dispersos, mecanismos compartidos difíciles de detectar

Fuente: anthropic.com/news/rare-disease-research-grants

(2/2): “falta un marco seguro para datos de pacientes”

Julien Gagneur (Universidad Técnica de Múnich)

  • Los términos no sirven para datos clínicos o genómicos de pacientes: quien acepta créditos garantiza que Anthropic puede recolectar, analizar y entrenar modelos con todos los inputs y outputs, con licencia perpetua e irrevocable
  • Tener permiso para analizar datos no es tener permiso para transferirlos a un tercero: la carga de gobernanza y el riesgo legal pasan al investigador y a su institución

(2/2): “falta un marco seguro para datos de pacientes”

  • Un agente conectado al entorno local lee archivos, corre comandos y envía outputs con tus credenciales: el dato puede salir sin que nadie lo suba, sobre todo si se aprueba código sin revisarlo
  • Propuesta: un modo de investigación protegido — sin entrenamiento ni licencia sobre datos de pacientes, procesamiento dentro del entorno aprobado, controles auditables y un acuerdo de procesamiento claro. Código, métodos y evaluaciones, abiertos

Fuente: medium.com/@gagneur — “…need a safer framework for patient data”

Shadow AI: de qué hablamos

Shadow AI es el uso no autorizado de cualquier herramienta o aplicación de inteligencia artificial por parte de empleados o usuarios finales, sin la aprobación formal ni la supervisión del área de TI.

IBM, «What is shadow AI?» (2024, traducción propia)

Riesgos nuevos: qué datos se envían a plataformas y modelos comerciales de manera voluntaria e involuntaria, cómo se integran a los activos institucionales las salidas de un modelo.

Shadow AI: el caso Samsung (ojo: 2023)

  • 2022: lanzamiento ChatGPT
  • Marzo 2023: Samsung levanta una restricción previa y habilita ChatGPT
  • Marzo-Abril 2023: un ingeniero pega el código fuente completo de un programa de su base de datos de semiconductores para pedir una corrección; otro hace lo mismo con el código de un equipo defectuoso; un tercero sube una reunión entera para que le arme las minutas
  • Medida de emergencia: limitación de largo de prompts
  • Mayo: vuelve la prohibición, ahora para toda herramienta de IA generativa. El motivo, según memo interno: lo que se transmite queda en servidores externos, es difícil de recuperar o borrar y podría terminar expuesto a otros usuarios

Nadie quiso filtrar nada: cada uno estaba resolviendo un problema de trabajo con la herramienta que tenía a mano

Fuentes: The Register, 6/4/2023 · Gizmodo, 4/2023 · Bloomberg, 2/5/2023

Por qué aparece Shadow AI en el 2026

  • Organizaciones sin equipo de IT dedicado (o sin disponibilidad para equipos interesados en IA)
  • Falta de financiación para IA institucional
  • Falta de conocimiento técnico para desplegar IAs en un marco de gobernanza institucional

Dónde puede salir el dato

¿Qué dato?

Confidencial

  • Credenciales y claves: en un .env, en el código, en una captura de pantalla
  • Bases de datos y planillas con datos de personas (pacientes, participantes, personal)
  • Historias clínicas, resultados, muestras

Interno

  • Características de mis proyectos u organización
  • Código, protocolos y documentos internos

¿Por dónde?

  • El prompt: «te pego la tabla así me ayudás»

  • El directorio compartido: IA con acceso a una carpeta lee todo lo que hay ahí

  • Los términos del servicio: el proveedor guarda inputs y outputs y, según el plan, entrena con ellos

  • Lo que la IA genera: apps con URL pública y base de datos sin reglas de acceso; repos con credenciales adentro

  • Las integraciones: conectores a Drive, mail o calendario; extensiones del navegador

Ejemplos de políticas universitarias

Harvard

  • Nada confidencial en herramientas públicas: datos de investigación, información médica, registros de personal (ni para minutas de reuniones!)
  • Con la configuración por defecto, lo que se comparte no es privado
  • Herramientas aprobadas, contratadas por universidad, específicas para datos sensibles

Penn State

  • Desidentificar no es infalible: la IA puede inferir identidades
  • Los metadatos también identifican: nombres de archivo, geolocalización, fechas
  • Nada identificable sin aprobación del CE
  • Investigadores deben obtener consentimiento de participantes si se usa IA generativa para analizar o procesar sus datos

Sheffield

Criterios mínimos antes de usar IA con datos sensibles (1/2)

  1. ¿Qué dato es?
    Clasificarlo antes de abrir el chat: público, interno o confidencial
  2. ¿Con qué herramienta?
    Aprobada por la institución, con contrato que prohíba entrenar con tus datos
  3. ¿Quién lo autorizó?
    Datos de pacientes o participantes → comité de ética + acuerdo de datos, antes de empezar

Criterios mínimos antes de usar IA con datos sensibles (2/2)

  1. ¿Se puede con menos?
    Muestras anonimizadas o sintéticas; sin metadatos que identifiquen
  2. ¿Qué más puede hacer la herramienta?
    Si lee tus datos, consume contenido externo y puede enviar cosas afuera → quitarle al menos una
  3. ¿Quién revisa lo que sale?
    Antes de publicar: ¿quién puede leer la base de datos? ¿Hay claves expuestas?

Fuentes:
«Cuidado con lo que le confIAs» — AEPD, 2026
«The lethal trifecta for AI agents» — S. Willison, 2025
«Common security risks in vibe-coded apps» — Wiz Research, 2025

Reflexiones y preguntas clave

Si lo que hacés con IA va a tener impacto real

Cualquier activo digital que afecte personas, proyectos o productos de una investigación requiere evaluar:

  • Sostenibilidad a mediano (o corto!) plazo
  • Seguridad, sensibilidad y riesgo institucional
  • Tus propios gaps de conocimiento respecto al problema abordado con la IA

Pero, además..

No seas un «meat proxy»

Adelante, consultá a la IA. Pero no te limites a reenviar lo que te devuelve. Leelo, entendelo, validalo, y después escribí una respuesta con tus propias palabras (un certificado bastante decente de que hiciste los pasos anteriores). Hacer ese esfuerzo es valor que podés aportar.

— Niklas Gruhn, «Don’t be a meat proxy», 3 de agosto de 2026 (traducción propia)

Sobre esto, 3 preguntas clave

¿Qué valor se espera que aportemos
en los proyectos en los que trabajamos?

¿En qué vale la pena invertir tiempo?

Dónde se almacenan los datos es una decisión

¿Es tu decisión?

¡Gracias!

María Cristina Nanton
mcnanton@gmail.com