>_ DevTrendses

Idioma

Inicio

Lenguajes

Secciones

Frontend Backend Móvil DevOps AI / ML GameDev Blockchain Embebidos Seguridad
TypeScript

Cómo conectar miles de parsers ya listos a tu LLM

Apify MCP Server

Cuando trabajas con modelos de lenguaje en proyectos reales, rápidamente te encuentras con el mismo problema. El modelo es excelente razonando y escribiendo código, pero es ciego. Necesita datos frescos del mundo externo: publicaciones actualizadas de redes sociales, contactos de empresas de mapas, fichas de productos de marketplaces o resultados frescos de motores de búsqueda.

Por lo general, en este punto, un desarrollador comienza a escribir herramientas personalizadas para Function Calling, construyendo envoltorios alrededor de Playwright o ensamblando pipelines a través de Cheerio. Después de un par de semanas manteniendo tales scripts, te das cuenta de que la mitad del tiempo se va en luchar contra captchas, diseños y selectores obsoletos.

El equipo de Apify resolvió este problema a través del Model Context Protocol, lanzando el proyecto apify-mcp-server. Esencialmente, convirtieron todo su catálogo de scrapers en la nube ya listos en una interfaz unificada de llamadas a herramientas para agentes de IA.

Qué es y por qué lo necesitas

El repositorio contiene una implementación de servidor MCP que conecta clientes locales o en la nube (Claude Desktop, Cursor, VS Code, ChatGPT) con la plataforma Apify. La plataforma ejecuta miles de scripts ya hechos llamados Actors. Cada uno de estos Actors puede obtener datos estructurados de sitios específicos: Google Maps, Facebook, Instagram, tiendas en línea, o simplemente rastrear sitios web para RAG.

MCP Clients

En lugar de describir manualmente esquemas para docenas de APIs para tu modelo, conectas un único endpoint. El asistente busca por sí mismo el scraper adecuado en el catálogo, lee su esquema JSON, valida los parámetros de entrada y lanza la recolección de datos.

Cómo funciona la llamada a herramientas

La característica principal del servidor es el descubrimiento dinámico de herramientas. No necesitas codificar la configuración de cada parser requerido de antemano.

Por defecto, el servidor le da al agente un conjunto básico de acciones:

  1. search-actors encuentra un scraper adecuado en el catálogo mediante consulta de texto.
  2. fetch-actor-details recupera el esquema de parámetros de entrada y la documentación del script encontrado.
  3. call-actor lanza la ejecución de la tarea en la infraestructura de Apify.
  4. get-dataset-items obtiene los resultados estructurados listos en lotes con soporte de paginación.
  5. apify--rag-web-browser está integrado como una herramienta rápida de búsqueda web y análisis de contenido para RAG.

Si le preguntas a Claude: "Encuentra los 10 mejores cafeterías en Praga en Google Maps con números de teléfono", el agente no dice que no tiene acceso. Llama a search-actors, encuentra el Google Maps Scraper, le pasa las coordenadas y la ciudad, espera el resultado y lee el conjunto de datos.

El modelo mismo genera este JSON, verificándolo contra el esquema de parámetros del scraper seleccionado.

Opciones de conexión: nube contra ejecución local

Puedes conectar el servidor al cliente de dos maneras. La elección depende de dónde viva tu agente.

1. Opción hosted a través de Streamable HTTP

El camino más fácil para Claude.ai o VS Code. El propio equipo de Apify lo aloja en mcp.apify.com. Se soporta autorización OAuth, así que en algunos clientes ni siquiera necesitas copiar tokens de API manualmente.

Si solo necesitas una herramienta específica sin carga extra en el contexto del modelo, puedes pasar parámetros directamente en la URL:

En este modo, el servidor le dará al agente solo una herramienta de búsqueda, sin saturar el contexto con metadatos de otros parsers.

2. Ejecución local a través de stdio

Si estás configurando Claude Desktop o un agente local en la terminal, lanza el servidor a través de npx:

El proceso local lee las variables de entorno, reúne los esquemas y se comunica con el cliente a través de flujos de entrada/salida estándar.

Pago sin crear una cuenta

Un detalle arquitectónico interesante se relaciona con la economía de los agentes. ¿Qué haces si un agente de IA trabaja de forma autónoma y no tiene un perfil de Apify registrado con una tarjeta vinculada?

Los desarrolladores incorporaron soporte para protocolos de pago automáticos:

  • AGI: el agente compra un token prepago con un límite a través de micropagos mediante x402 o MPP y lo usa como un token Bearer estándar.
  • Direct x402: pago en USDC en la red Base para cada ejecución específica a través de la utilidad mcpc. El saldo no utilizado se devuelve automáticamente a la billetera del agente después de 60 minutos de inactividad.
  • Skyfire: el agente genera tokens de pago a través de la infraestructura de Skyfire y los pasa en los parámetros de llamada a herramientas.

Esto elimina el dolor de cabeza de la facturación cuando los agentes operan en entornos completamente aislados.

Matices técnicos y limitaciones

La base de código contiene varias soluciones prácticas que vale la pena considerar durante la integración:

  • Los esquemas de parámetros de entrada se recortan. Las descripciones largas de campos se truncan a 500 caracteres y las listas de valores enum se limitan a 20,000 caracteres. Esto es intencional para que los esquemas pesados de parsers complejos no consuman la ventana de contexto del modelo.
  • La llamada call-actor no devuelve toda la matriz de datos analizados de una vez en la primera respuesta. Devuelve el ID del conjunto de datos y los metadatos de la ejecución. Para obtener las filas, el agente hace el siguiente paso a través de get-dataset-items. Esto protege el contexto de desbordarse con gigabytes de texto.
  • El envío de telemetría y Sentry están habilitados por defecto en modo stdio. Puedes deshabilitarlos con el indicador --telemetry-enabled=false o la variable de entorno TELEMETRY_ENABLED=false.

A quién le será útil este proyecto en la práctica

Si estás construyendo agentes autónomos para investigación, análisis de competidores, generación de leads o monitoreo de precios, el proyecto te ahorrará semanas de trabajo en infraestructura de scraping. En lugar de escribir tus propios crawlers, obtienes acceso listo a parsers probados a través de un protocolo estandarizado.

La forma más fácil de comenzar es conectando el endpoint hosted https://mcp.apify.com a Claude Desktop o Cursor y probando la herramienta básica apify/rag-web-browser. Para tareas de producción específicas, es mejor codificar inmediatamente la lista de herramientas a través del parámetro tools para que el agente no gaste tokens en búsquedas innecesarias en el catálogo.

Proyectos relacionados