¿Qué son los Data Connectors (LlamaHub) de LlamaIndex?

Un data connector, o Reader, ingiere datos de diferentes fuentes de datos y formatos a un objeto Document.

Cuando estas trabajando en producción se recomienda utilizar los data connector que ofrece LlamaIndex a través de LlamaHub, un repositorio open-source que contiene data loaders que puedes integrar fácilmente en tu aplicación para diferentes casos de uso.

Vamos a ver un ejemplo:

# Sitemap Loader, ideal para cargar texto de páginas web estáticas utilizando el sitemap del sitio web.
# Es un loader asíncrono (web scraper) que convierte código HTML en texto.

# %pip install llama-index-readers-web

# for jupyter notebooks uncomment the following two lines of code:
import nest_asyncio
nest_asyncio.apply()

from llama_index.readers.web import SitemapReader

loader = SitemapReader()

documents = loader.load_data(
    sitemap_url="https://gpt-index.readthedocs.io/sitemap.xml",
    filter="https://gpt-index.readthedocs.io/en/latest/",
)

documents

LlamaParse

LlamaParse es una API creada por LlamaIndex para analizar y representar archivos de manera eficiente utilizando el framework de LlamaIndex. Actualmente solo está disponbile para archivos PDF.

1. Crea una cuenta en https://cloud.llamaindex.ai

2. Instala el paquete %pip install llama-parse

# %pip install llama-parse

from llama_parse import LlamaParse

parser = LlamaParse(
    api_key="llx-...",  # can also be set in your env as LLAMA_CLOUD_API_KEY
    result_type="markdown",  # "markdown" and "text" are available
    verbose=True,
)

# sync
documents = parser.load_data("data/TSLA-Q1-2024-Update.pdf")
documents

Lee estos artículos relacionados:

SimpleDirectoryReader. ¿Cómo cargar datos de archivos locales con LlamaIndex?

CREDITS: https://docs.llamaindex.ai/en/stable/module_guides/loading/connector