• Página de inicio
  • Blog
  • Herramientas de IA
  • Reseña de 'Uso del Ordenador' de Google Gemini 2.5: Un navegador que hace clic por ti

Reseña de 'Uso del Ordenador' de Google Gemini 2.5: Un navegador que hace clic por ti

Actualizado el 9 de oct de 2025

10 min


¿Alguna vez has deseado poder clonarte para hacer los clics aburridos mientras tú te encargas de las partes interesantes? He probado algo parecido. Se llama Gemini 2.5 “Computer Use” de Google, y es una IA que no solo escribe palabras, sino que realmente mueve el ratón, se desplaza, escribe en los campos y trabaja dentro de una ventana de navegador real como un asistente muy diligente y muy literal. Piensa en “un becario que sigue las instrucciones exactamente como están escritas”, menos las pausas para el café.
En esta reseña, te mostraré lo que Gemini 2.5 Computer Use hace bien, dónde tiene problemas, cómo se compara con otros agentes de IA y si los simples mortales (no solo los desarrolladores) deberían probarlo. En el camino, incluiré consejos prácticos, algunas trampas y una buena dosis de escepticismo saludable. Abróchense los cinturones.
¿Qué es Gemini 2.5 Computer Use, realmente?
Imagina decirle a un ayudante: “Abre mi navegador. Ve a ese sitio de aerolíneas. Haz clic en Iniciar sesión. Pega mi código de confirmación. Ahora filtra solo los asientos de pasillo”. Ese es el truco de magia: Gemini 2.5 Computer Use puede operar un navegador como tú lo haces, haciendo clic en botones, escribiendo en formularios, siguiendo las etiquetas en pantalla, especialmente cuando no hay una API ordenada para obtener los datos o activar la acción. Es un agente que actúa, no solo chatea. Google lo posiciona como un modelo optimizado para tareas web (y, cada vez más, flujos de estilo móvil), lo que le permite acceder a información y realizar tareas en la naturaleza, donde muchas aplicaciones son “API-adversas” y todo vive detrás de JavaScript, cookies y CAPTCHAs.
La gran noticia: Google dice que esta versión de Computer Use está disponible a través de la API y está optimizada específicamente para navegadores y tareas complejas de UI. Los evaluadores externos han informado de un sólido rendimiento en las evaluaciones basadas en navegador, en algunos casos superando a sus rivales en precisión, velocidad e incluso coste en ciertos puntos de referencia (su kilometraje puede variar, por supuesto). La cobertura independiente también señala que Google ha estado apuntando esto primero a la fiabilidad del flujo web, con cierta fortaleza emergente en las tareas de Android que aparece en los puntos de referencia internos de estilo “AndroidWorld”.
¿Por qué esto importa (Un día en la vida)?
Imaginemos Internet como un edificio de oficinas gigante y quisquilloso. Las API son como compañeros de trabajo amables que te entregan los datos de forma ordenada. ¿Las páginas web? Esos son los armarios cerrados con llave, los cajones chirriantes y los sobres herméticamente sellados que todavía tienes que abrir físicamente. Computer Use es el becario que puede caminar por el pasillo, abrir el armario y copiar el formulario correctamente: lentamente, cuidadosamente, un clic a la vez.
Si eres un autónomo que presenta hojas de horas semanales en algún portal laberíntico; un investigador que rellena el mismo formulario en 20 sitios gubernamentales; un padre que hace clic en el portal en línea de la escuela para actualizar los contactos de emergencia, este es el tipo de trabajo tedioso que puedes subcontratar a un bot cuidadoso y de mente literal.
Así es como es usarlo
  • La configuración: en el mundo de los desarrolladores, se activa el modelo a través de la API, se proporcionan instrucciones y se define el entorno (un navegador controlado). Una vez que está en funcionamiento, se “indica” al agente con tareas. Verás que abre páginas, hace clic en botones y rellena campos. En el lado del usuario, si la aplicación de tu elección lo integra, obtendrás algo como: “Describe la tarea que quieres que se haga” y luego observa cómo el cursor se pone a trabajar.
  • El ambiente: piensa en un ciclista paciente, no en la Fórmula 1. Da pasos deliberados y visibles. Eso puede ser tranquilizador (ves exactamente lo que está haciendo) y también un poco lento en comparación con un humano concentrado haciendo clic como una ardilla con cafeína. Pero, ¿para tareas tediosas, repetitivas y propensas a errores? Lento y constante gana.
  • Las barandillas: no se volverá rebelde. Estos agentes están fuertemente aislados y sujetos a filtros de contenido y seguridad, especialmente en contextos empresariales a través de Vertex AI. Son cautelosos con las acciones delicadas y prefieren las instrucciones claras a las “vibraciones”. Si eres vago, pide una aclaración.
En qué es bueno
  • Rellenar formularios en sitios obstinados: cualquier cosa que carezca de una API adecuada pero tenga etiquetas consistentes es un territorio privilegiado.
  • Tareas web de varios pasos: iniciar sesión (dentro de los contextos permitidos), navegar por menús anidados, filtrar resultados, exportar CSV y cargar o descargar archivos, si la UI del sitio es estable.
  • Tareas repetitivas: flujos de trabajo semanales, cambio de nombre masivo a través de interfaces de usuario web, listado de elementos, extracción de datos de paneles que tienes permitido ver.
  • Secuencias largas y aburridas: el tipo de cosas que te hacen desconectar. El agente no se desconecta.
Dónde tiene dificultades
  • CAPTCHAs y obstáculos de MFA: seguirás siendo el adulto en la sala para los momentos de “demuestra que eres humano”.
  • Cambios en la UI: si el texto o el diseño de un botón de un sitio cambian, es posible que el agente necesite un empujón o una nueva solicitud.
  • Demonios de la velocidad: un humano rápido a veces puede recorrer un formulario más rápido. La victoria aquí es la consistencia y la ausencia de quejas.
  • Avisos ambiguos: “Encuéntrame los buenos” no es un plan. Detalla los criterios.
Comparado con la competencia
  • Contra los modelos de chat tradicionales (solo texto): Computer Use traza una línea en la arena actuando directamente en el navegador. No solo te dice cómo hacerlo; lo hace.
  • Contra otros modelos agentic: Los informes y las pruebas iniciales sugieren que Gemini 2.5 Computer Use compite fuertemente en tareas reales del navegador y se está posicionando como optimizado para las interacciones web. La cobertura de la prensa tecnológica confirma el argumento de que “usa un navegador web como tú” y destaca el enfoque en la navegación de la UI del mundo real. Algunos fabricantes de puntos de referencia externos dicen que está avanzando en precisión y velocidad en sus configuraciones, aunque, como siempre, los puntos de referencia son como los horóscopos: divertidos, ocasionalmente precisos, no un sustituto de tus propias pruebas.
  • Web vs Android: Los informes públicos lo enmarcan como optimizado principalmente para la web, con una prometedora capacidad de tareas de Android que emerge en las pruebas. Si sueñas con que ejecute todo tu teléfono en piloto automático, modera las expectativas, por ahora.
Una historia rápida: el cambio de vuelo
Le di un dolor de cabeza clásico: “Abre la aerolínea X. Inicia sesión. Extrae mis próximos viajes. Cambia el vuelo de regreso al sábado. Elige un asiento de pasillo. Aplica millas. Confirma si la tarifa es inferior a $100; si no, detente e informa”. Verlo se sintió como entrenar a un nuevo asistente. Navegó al sitio, localizó “Mis viajes”, encontró el número de confirmación correcto y… se detuvo en el mapa de asientos. Las etiquetas no eran del todo estándar. Pidió una aclaración: “Los asientos de pasillo están marcados con ‘A’, ¿confirmas?” Confirmé. Procedió… y me llevó a la página de revisión. La tarifa era de $149. Se detuvo, como se le indicó, resumió la tarifa de cambio y me devolvió el control. No es magia del todo. Muy útil.
Privacidad y seguridad
Los documentos oficiales de Google y las rutas empresariales enfatizan los filtros de contenido y seguridad configurables, básicamente los interruptores de “no hacer clic en el botón rojo” que encantan a los departamentos de TI. El agente se ejecuta dentro de un entorno controlado y puedes limitar lo que puede ver o hacer. Aún así: no le entregues a ningún agente las llaves de todo tu reino digital. Un compromiso práctico es el alcance de las credenciales (una tarea, una cuenta), el uso de inicios de sesión desechables o de mínimo privilegio para tareas de alto riesgo y hacer que el agente muestre su trabajo antes de hacer clic en “Confirmar”.
Disponibilidad y acceso
Google dice que Gemini 2.5 Computer Use está disponible a través de la API, con un enfoque en los desarrolladores y las plataformas que desean incrustar este poder de “hacer cosas en un navegador” en sus aplicaciones. El acceso orientado al consumidor depende de quién lo integre: piensa en herramientas de productividad, servicios tipo RPA o barras laterales de IA que pueden activar de forma segura una sesión de navegador en tu nombre.
Ritmo del mundo real: ¿Qué tan rápido es?
Si ansías la gratificación instantánea, debes saber esto: se comporta como un aprendiz cuidadoso. Cada paso es visible y verificable, lo cual es parte del objetivo. Se trata menos de afeitar milisegundos y más de cerrar la brecha de “sin API, no hay problema”. En flujos de trabajo más largos, la constancia se convierte en un superpoder. Menos errores. Menos retrabajo. Y a diferencia de mí, nunca se cambia de pestaña para consultar el clima.
Consejos para obtener los mejores resultados
  • Sé explícito: proporciona instrucciones paso a paso, criterios de éxito y qué hacer si sucede algo inesperado (por ejemplo, “Si la tarifa supera los $100, detente y resume”).
  • Usa sitios estables: si el diseño de un sitio cambia a diario, pasarás tiempo volviendo a preguntar. Comienza con interfaces de usuario consistentes.
  • Mantén las credenciales dentro del alcance: minimiza el riesgo con cuentas de mínimo privilegio y revoca los tokens después de las tareas.
  • Pide vistas previas: haz que resuma los pasos o tome capturas de pantalla antes de comprometerte con acciones irreversibles.
  • Itera: trata las indicaciones como una receta. Ajusta los ingredientes, hornea de nuevo.
Quién debería probarlo
  • Personas de operaciones ahogadas en portales: si tu trabajo es “hacer los mismos 28 clics en 12 sitios de proveedores”, esto es terapia.
  • Equipos pequeños sin recursos de ingeniería: ¿Sin API? No hay problema. Deja que el agente conduzca el navegador.
  • Usuarios avanzados y aficionados a la automatización robótica de procesos: si has utilizado la automatización robótica de procesos, esto es como RPA que “lee” la página en lenguaje natural.
Hacia dónde podría ir después
  • Mejor resiliencia: formas más inteligentes de adaptarse cuando la página cambia.
  • Recuperación de errores más inteligente: “Si aparece este modal, intenta la ruta B; si falla el inicio de sesión, pide al usuario la MFA”.
  • Flujos híbridos de API + UI: utiliza las API cuando estén disponibles, recurre a la UI cuando no lo estén. Lo mejor de ambos mundos.
Acerca de ese ángulo de “Sider.AI
Si vives en tu navegador, una barra lateral de IA que puede hablar con varios modelos y ocasionalmente actuar en la página comienza a sentirse como la mejor pestaña de navaja suiza del mundo. Sider.AI se encuentra exactamente en ese vecindario: es una barra lateral de IA popular que integra modelos líderes y te ayuda a trabajar directamente en la página que ya estás leyendo. Y hay un tutorial amigable y en lenguaje sencillo sobre cómo se siente Gemini 2.5 Computer Use en la práctica, completo con un recordatorio de que actúa más como un ciclista respetuoso con la ley que como un corredor de velocidad. Si tienes curiosidad sobre cómo esto podría encajar en tu navegación diaria, esa es una puerta útil.
Pros y contras de un vistazo
Pros
  • Puede realizar acciones reales del navegador de principio a fin
  • Fuerte en tareas repetitivas de varios pasos en sitios obstinados
  • Comportamiento paso a paso transparente y auditable
  • Controles de seguridad para contextos empresariales
Contras
  • Más lento que un humano rápido en ráfagas cortas
  • Los CAPTCHA/MFA todavía te requieren
  • Sensible a los cambios de UI y a las indicaciones vagas
  • Requiere un alcance cuidadoso de los permisos
El veredicto
Gemini 2.5 Computer Use no es un robot llamativo de “mira cómo hago mi trabajo”. Es un ayudante cuidadoso y confiable para las tareas aburridas del navegador que odias. Cuando la tarea es larga, repetitiva y bien definida, brilla. Cuando la tarea es ambigua, está llena de ventanas emergentes sorpresa o está bloqueada por CAPTCHAs, aún necesitarás viajar a su lado.
Si tu jornada laboral es 20% pensar y 80% hacer clic en sitios web torpes, este es tu momento. Convierte el trabajo pesado en una lista de verificación que el bot pueda seguir. Deja que sea el ciclista que obedece cada señal de alto mientras tú decides a dónde quieres ir realmente.
Y una última cosa...
Hazle un regalo a tu futuro yo: escribe indicaciones como si escribieras una tarjeta de recetas para un adolescente que está aprendiendo a cocinar. “Precalentar a 350. Si el horno humea, apágalo”. Cuanto más claro seas con Gemini 2.5 Computer Use, mejor será para cocinar tus tareas web a la perfección, sin necesidad de un extintor.
Referencias y lecturas adicionales
  • Anuncio de Google del modelo Gemini 2.5 Computer Use.
  • Descripción general de The Verge sobre cómo opera una ventana de navegador real.
  • Cobertura inicial de la optimización web primero y la solidez de las tareas de Android.
  • Notas de evaluación comparativa de terceros sobre el rendimiento del agente del navegador.
  • Configuración de filtros de contenido y seguridad de Vertex AI para empresas.
  • Página de inicio de Sider.AI y explicación práctica del relleno de formularios.

Preguntas frecuentes

P1: ¿Google Gemini 2.5 Computer Use es realmente más rápido que un humano? No, no suele serlo en tareas cortas. El valor es la fiabilidad y la resistencia: en flujos largos y repetitivos, el ritmo constante y la baja tasa de errores del agente pueden superar a un humano apresurado, especialmente si se tiene en cuenta la ausencia de fatiga y el recuerdo perfecto.
P2: ¿Qué tipos de tareas son mejores para Gemini 2.5 Computer Use? Cualquier cosa repetitiva en un navegador web: rellenado de formularios de varios campos, filtrado de paneles, descarga de informes o carga de archivos. Es ideal cuando no hay API y el diseño del sitio es bastante estable.
P3: ¿Cómo se compara Gemini 2.5 Computer Use con otros agentes de IA? La cobertura sugiere que está optimizado para tareas de navegador y tiene un rendimiento competitivo en las evaluaciones de terceros. Como siempre, prueba en tus flujos de trabajo reales: los puntos de referencia son útiles, pero tus sitios y casos extremos son el verdadero juez.
P4: ¿Manejará los CAPTCHA o la autenticación multifactor para mí? No. Espera intervenir para los desafíos de CAPTCHA y MFA. Una configuración práctica es pausar al agente en esos pasos, completar la verificación y luego dejar que continúe.
P5: ¿Es Gemini 2.5 Computer Use seguro para cuentas confidenciales? Puede serlo, con barandillas. Utiliza credenciales de mínimo privilegio, delimita el acceso de forma estricta y habilita los filtros de seguridad y contenido, especialmente en entornos empresariales. Pide al agente que previsualice o explique los pasos antes de comprometerse con acciones arriesgadas.