Agentes2 min de lectura
Agentes que usan el navegador y el ordenador: qué pueden hacer
Cómo funcionan los agentes que navegan y manejan programas por ti (Claude en Chrome, la Agents API, Muse), para qué sirven y qué precauciones tomar.
Hasta hace poco, un asistente de IA solo podía hablar contigo. Los agentes de navegador y de uso del ordenador dan un paso más: ven la pantalla, mueven el puntero, hacen clic y escriben, como harías tú. Así pueden rellenar formularios, comparar productos en varias webs o manejar programas que no tienen API.
Cómo funcionan
El agente funciona en bucle, como cualquier agente:
- Recibe una captura de pantalla (o el contenido de la página).
- El modelo, que es multimodal, decide la siguiente acción: clic aquí, escribir esto, desplazarse.
- La herramienta ejecuta la acción y toma otra captura.
- Repite hasta terminar o hasta necesitar tu confirmación.
Ejemplos que ya existen
- Claude en Chrome: una extensión para Chrome de escritorio, disponible en los planes de pago de Claude, que lee páginas, hace clic, escribe y se mueve entre pestañas desde un panel lateral.
- Agents API de OpenAI: incluye una herramienta de uso del ordenador para que los desarrolladores creen agentes que manejan programas a través de su interfaz.
- Muse, de Meta: un agente personal que hace gestiones en segundo plano (correos, reservas, compras) con un segundo agente que vigila lo que sale a internet. De momento, solo en Estados Unidos; te lo contamos en esta noticia.
Para qué sirven bien
- Tareas repetitivas en webs sin API: copiar datos de un portal a una hoja de cálculo, descargar facturas de varias webs.
- Comparar: precios, características o condiciones en varias páginas.
- Rellenar formularios largos con datos que ya tienes.
- Probar webs: los equipos de desarrollo los usan para comprobar que una aplicación funciona como la usaría una persona.
Sus límites
- Son lentos comparados con una integración directa: cada paso requiere mirar la pantalla y pensar.
- Se equivocan con interfaces confusas, ventanas emergentes o cambios de diseño.
- Cuestan más tokens, porque procesan imágenes en cada paso.
Si existe una API o un conector MCP para lo que quieres hacer, suele ser más rápido, barato y fiable que un agente que hace clic.
Precauciones
Un agente que navega lee contenido que tú no controlas, y ahí está el riesgo principal: la inyección de prompts. Una web puede esconder instrucciones para engañarlo.
- Empieza con sesiones sin cuentas importantes: no lo dejes navegar con tu banco o tu correo abiertos hasta que confíes en él.
- Confirmación antes de pagar, enviar o borrar. Cualquier producto serio la pide; no la desactives.
- Supervisa las primeras veces: mira lo que hace, paso a paso.
- Tareas acotadas: «compara estos tres hoteles» mejor que «organízame las vacaciones».
Tienes más medidas en seguridad de agentes.
Preguntas frecuentes
¿Puede un agente comprar o reservar por mí?
Técnicamente sí, y algunos productos lo ofrecen. Hazlo siempre con confirmación antes de pagar y empieza por tareas de bajo riesgo.
¿Por qué son más lentos que una API?
Porque trabajan como una persona: miran la pantalla, deciden, hacen clic y esperan a que cargue. Cada paso es una llamada al modelo con una captura de pantalla.


