Rastreo de contenidos
Periodismo2 lee páginas públicas de otros medios para enterarse de qué se publicó. Esta página explica cómo lo hace y cómo puedes pedirnos que dejemos de hacerlo en tu sitio.
Cómo nos identificamos
El rastreador de noticias (feeds, sitemaps y notas) y el de documentos públicos llevan el mismo User-Agent, que no imita a un navegador:
Periodismo2Bot/1.0 (+https://periodismo2.cl/legal/rastreo)
El nombre del producto es Periodismo2Bot. Si necesitas reconocernos en tus registros o escribir una regla en tu robots.txt, usa ese nombre.
Qué leemos
- Sitemaps y sitemaps de noticias que el propio medio publica, y las notas que listan.
- Feeds RSS que el propio medio publica, y la página pública de cada nota que enlazan.
No iniciamos sesión en ningún sitio ni saltamos muros de pago o bloqueos: si una página responde con error o prohíbe el acceso, no insistimos.
Con qué frecuencia y bajo qué reglas
- Sitemaps. Respetamos
robots.txtsegún el estándar RFC 9309, tanto para el sitemap como para cada nota que lista. Si tiene un grupo paraPeriodismo2Bot, seguimos ese grupo; si no, el grupo general. Respetamos tambiénCrawl-delay, con un tope de 10 segundos, como pausa entre las peticiones alrobots.txty al sitemap, que nunca bajan de un segundo. Cada sitemap se consulta como máximo una vez cada 10 a 60 minutos, según el medio, y de cada consulta tomamos solo las notas más recientes de las secciones que nos interesan. Esas notas se descargan con una petición por página, una por cada nota nueva, sin una pausa por sitio entre ellas, y solo si turobots.txtlas permite. - Feeds RSS. Leemos cada feed a intervalos acotados, con una pausa de un segundo entre feeds. Para las notas que un feed enlaza, hoy no consultamos
robots.txt: si no quieres que leamos tu sitio por esta vía, pídenos la exclusión como se explica más abajo y la aplicamos por dominio.
Cómo citamos y enlazamos
Cada nota nuestra que parte de una publicación de otro medio nombra a ese medio y enlaza a la publicación original, para que quien nos lee pueda ir a la fuente. Puedes ver el criterio completo en nuestros estándares editoriales.
Cómo pedir que no leamos tu sitio
En los sitemaps basta agregar a tu robots.txt:
User-agent: Periodismo2Bot
Disallow: /Para cualquier vía, incluidos los feeds RSS, escríbenos a [email protected] con el dominio y, si corresponde, las secciones que quieres excluir. Si ya publicamos algo tuyo que quieres corregir o retirar, indícanos la dirección de la nota.