After-the-CM / After-the-CM/Himawari
`robots.txt` を読み取り、`robots.txt` のルールに沿ったクローリングを行う
Offen
Crawler
good first issue
help wanted
priority: high
- Vorherrschende Sprache
- Go
- Sterne
- 9
- Forks
- 1
- PR-Merge-Kennzahlen
- Keine gemergten PRs in 30 T.
Beschreibung
## 概要
`robots.txt` とは、検索エンジンのクローラーに対して、サイトのどの URL にアクセスしてよいかを伝えるものである。
`robots.txt` を読み取り、`robots.txt` のルールに沿ったクローリングを行う。
## 方針
大きく二段階に分かれると考えられる。
1. `robots.txt` の内容を取得し、ルールを理解する
[grobotstxt](https://github.com/jimsmart/grobotstxt)のような`robots.txt` のパーサを利用する。
2. `robots.txt` に記載されている情報も活用してクロールする
Beitragsleitfaden
Bewertung
Dieses Issue wurde noch nicht bewertet.