After-the-CM / After-the-CM/Himawari

`robots.txt` を読み取り、`robots.txt` のルールに沿ったクローリングを行う

Offen
#154 1 Kommentar 0 Reaktionen 0 zugewiesene Personen Auf GitHub ansehen
Crawler good first issue help wanted priority: high
Vorherrschende Sprache
Go
Sterne
9
Forks
1
PR-Merge-Kennzahlen
Keine gemergten PRs in 30 T.

Beschreibung

## 概要

`robots.txt` とは、検索エンジンのクローラーに対して、サイトのどの URL にアクセスしてよいかを伝えるものである。
`robots.txt` を読み取り、`robots.txt` のルールに沿ったクローリングを行う。

## 方針

大きく二段階に分かれると考えられる。

1. `robots.txt` の内容を取得し、ルールを理解する

[grobotstxt](https://github.com/jimsmart/grobotstxt)のような`robots.txt` のパーサを利用する。

2. `robots.txt` に記載されている情報も活用してクロールする

Beitragsleitfaden

Beitragsleitfaden öffnen

Bewertung

Dieses Issue wurde noch nicht bewertet.

Neue Issues direkt in Ihr Postfach

Eine kurze Übersicht über anfängerfreundliche GitHub-Issues.