Cómo conectar miles de parsers ya listos a tu LLM
Cuando trabajas con modelos de lenguaje en proyectos reales, rápidamente te encuentras con el mismo problema. El modelo es excelente razonando y escribiendo código, pero es ciego. Necesita datos frescos del mundo externo: publicaciones actualizadas de redes sociales, contactos de empresas de mapas, fichas de productos de marketplaces o resultados frescos de motores de búsqueda.
Por lo general, en este punto, un desarrollador comienza a escribir herramientas personalizadas para Function Calling, construyendo envoltorios alrededor de Playwright o ensamblando pipelines a través de Cheerio. Después de un par de semanas manteniendo tales scripts, te das cuenta de que la mitad del tiempo se va en luchar contra captchas, diseños y selectores obsoletos.
El equipo de Apify resolvió este problema a través del Model Context Protocol, lanzando el proyecto apify-mcp-server. Esencialmente, convirtieron todo su catálogo de scrapers en la nube ya listos en una interfaz unificada de llamadas a herramientas para agentes de IA.
Qué es y por qué lo necesitas
El repositorio contiene una implementación de servidor MCP que conecta clientes locales o en la nube (Claude Desktop, Cursor, VS Code, ChatGPT) con la plataforma Apify. La plataforma ejecuta miles de scripts ya hechos llamados Actors. Cada uno de estos Actors puede obtener datos estructurados de sitios específicos: Google Maps, Facebook, Instagram, tiendas en línea, o simplemente rastrear sitios web para RAG.
En lugar de describir manualmente esquemas para docenas de APIs para tu modelo, conectas un único endpoint. El asistente busca por sí mismo el scraper adecuado en el catálogo, lee su esquema JSON, valida los parámetros de entrada y lanza la recolección de datos.
Cómo funciona la llamada a herramientas
La característica principal del servidor es el descubrimiento dinámico de herramientas. No necesitas codificar la configuración de cada parser requerido de antemano.
Por defecto, el servidor le da al agente un conjunto básico de acciones:
search-actorsencuentra un scraper adecuado en el catálogo mediante consulta de texto.fetch-actor-detailsrecupera el esquema de parámetros de entrada y la documentación del script encontrado.call-actorlanza la ejecución de la tarea en la infraestructura de Apify.get-dataset-itemsobtiene los resultados estructurados listos en lotes con soporte de paginación.apify--rag-web-browserestá integrado como una herramienta rápida de búsqueda web y análisis de contenido para RAG.
Si le preguntas a Claude: "Encuentra los 10 mejores cafeterías en Praga en Google Maps con números de teléfono", el agente no dice que no tiene acceso. Llama a search-actors, encuentra el Google Maps Scraper, le pasa las coordenadas y la ciudad, espera el resultado y lee el conjunto de datos.
El modelo mismo genera este JSON, verificándolo contra el esquema de parámetros del scraper seleccionado.
Opciones de conexión: nube contra ejecución local
Puedes conectar el servidor al cliente de dos maneras. La elección depende de dónde viva tu agente.
1. Opción hosted a través de Streamable HTTP
El camino más fácil para Claude.ai o VS Code. El propio equipo de Apify lo aloja en mcp.apify.com. Se soporta autorización OAuth, así que en algunos clientes ni siquiera necesitas copiar tokens de API manualmente.
Si solo necesitas una herramienta específica sin carga extra en el contexto del modelo, puedes pasar parámetros directamente en la URL:
En este modo, el servidor le dará al agente solo una herramienta de búsqueda, sin saturar el contexto con metadatos de otros parsers.
2. Ejecución local a través de stdio
Si estás configurando Claude Desktop o un agente local en la terminal, lanza el servidor a través de npx:
El proceso local lee las variables de entorno, reúne los esquemas y se comunica con el cliente a través de flujos de entrada/salida estándar.
Pago sin crear una cuenta
Un detalle arquitectónico interesante se relaciona con la economía de los agentes. ¿Qué haces si un agente de IA trabaja de forma autónoma y no tiene un perfil de Apify registrado con una tarjeta vinculada?
Los desarrolladores incorporaron soporte para protocolos de pago automáticos:
- AGI: el agente compra un token prepago con un límite a través de micropagos mediante x402 o MPP y lo usa como un token Bearer estándar.
- Direct x402: pago en USDC en la red Base para cada ejecución específica a través de la utilidad
mcpc. El saldo no utilizado se devuelve automáticamente a la billetera del agente después de 60 minutos de inactividad. - Skyfire: el agente genera tokens de pago a través de la infraestructura de Skyfire y los pasa en los parámetros de llamada a herramientas.
Esto elimina el dolor de cabeza de la facturación cuando los agentes operan en entornos completamente aislados.
Matices técnicos y limitaciones
La base de código contiene varias soluciones prácticas que vale la pena considerar durante la integración:
- Los esquemas de parámetros de entrada se recortan. Las descripciones largas de campos se truncan a 500 caracteres y las listas de valores enum se limitan a 20,000 caracteres. Esto es intencional para que los esquemas pesados de parsers complejos no consuman la ventana de contexto del modelo.
- La llamada
call-actorno devuelve toda la matriz de datos analizados de una vez en la primera respuesta. Devuelve el ID del conjunto de datos y los metadatos de la ejecución. Para obtener las filas, el agente hace el siguiente paso a través deget-dataset-items. Esto protege el contexto de desbordarse con gigabytes de texto. - El envío de telemetría y Sentry están habilitados por defecto en modo stdio. Puedes deshabilitarlos con el indicador
--telemetry-enabled=falseo la variable de entornoTELEMETRY_ENABLED=false.
A quién le será útil este proyecto en la práctica
Si estás construyendo agentes autónomos para investigación, análisis de competidores, generación de leads o monitoreo de precios, el proyecto te ahorrará semanas de trabajo en infraestructura de scraping. En lugar de escribir tus propios crawlers, obtienes acceso listo a parsers probados a través de un protocolo estandarizado.
La forma más fácil de comenzar es conectando el endpoint hosted https://mcp.apify.com a Claude Desktop o Cursor y probando la herramienta básica apify/rag-web-browser. Para tareas de producción específicas, es mejor codificar inmediatamente la lista de herramientas a través del parámetro tools para que el agente no gaste tokens en búsquedas innecesarias en el catálogo.
Proyectos relacionados