Saltar al contenido
estudIA

Agentes2 min de lectura

Agentes que usan el navegador y el ordenador: qué pueden hacer

Cómo funcionan los agentes que navegan y manejan programas por ti (Claude en Chrome, la Agents API, Muse), para qué sirven y qué precauciones tomar.

Hasta hace poco, un asistente de IA solo podía hablar contigo. Los agentes de navegador y de uso del ordenador dan un paso más: ven la pantalla, mueven el puntero, hacen clic y escriben, como harías tú. Así pueden rellenar formularios, comparar productos en varias webs o manejar programas que no tienen API.

Cómo funcionan

El agente funciona en bucle, como cualquier agente:

  1. Recibe una captura de pantalla (o el contenido de la página).
  2. El modelo, que es multimodal, decide la siguiente acción: clic aquí, escribir esto, desplazarse.
  3. La herramienta ejecuta la acción y toma otra captura.
  4. Repite hasta terminar o hasta necesitar tu confirmación.

Ejemplos que ya existen

  • Claude en Chrome: una extensión para Chrome de escritorio, disponible en los planes de pago de Claude, que lee páginas, hace clic, escribe y se mueve entre pestañas desde un panel lateral.
  • Agents API de OpenAI: incluye una herramienta de uso del ordenador para que los desarrolladores creen agentes que manejan programas a través de su interfaz.
  • Muse, de Meta: un agente personal que hace gestiones en segundo plano (correos, reservas, compras) con un segundo agente que vigila lo que sale a internet. De momento, solo en Estados Unidos; te lo contamos en esta noticia.

Para qué sirven bien

  • Tareas repetitivas en webs sin API: copiar datos de un portal a una hoja de cálculo, descargar facturas de varias webs.
  • Comparar: precios, características o condiciones en varias páginas.
  • Rellenar formularios largos con datos que ya tienes.
  • Probar webs: los equipos de desarrollo los usan para comprobar que una aplicación funciona como la usaría una persona.

Sus límites

  • Son lentos comparados con una integración directa: cada paso requiere mirar la pantalla y pensar.
  • Se equivocan con interfaces confusas, ventanas emergentes o cambios de diseño.
  • Cuestan más tokens, porque procesan imágenes en cada paso.

Si existe una API o un conector MCP para lo que quieres hacer, suele ser más rápido, barato y fiable que un agente que hace clic.

Precauciones

Un agente que navega lee contenido que tú no controlas, y ahí está el riesgo principal: la inyección de prompts. Una web puede esconder instrucciones para engañarlo.

  • Empieza con sesiones sin cuentas importantes: no lo dejes navegar con tu banco o tu correo abiertos hasta que confíes en él.
  • Confirmación antes de pagar, enviar o borrar. Cualquier producto serio la pide; no la desactives.
  • Supervisa las primeras veces: mira lo que hace, paso a paso.
  • Tareas acotadas: «compara estos tres hoteles» mejor que «organízame las vacaciones».

Tienes más medidas en seguridad de agentes.

Preguntas frecuentes

¿Puede un agente comprar o reservar por mí?

Técnicamente sí, y algunos productos lo ofrecen. Hazlo siempre con confirmación antes de pagar y empieza por tareas de bajo riesgo.

¿Por qué son más lentos que una API?

Porque trabajan como una persona: miran la pantalla, deciden, hacen clic y esperan a que cargue. Cada paso es una llamada al modelo con una captura de pantalla.

Términos del glosario

Fuentes

Artículos relacionados