robots.txt の作成と書き方(Googlebot / AI クローラー拒否設定例)

robots.txt SEO クローラ AI Web開発
結論:30秒で robots.txt を作成・配置する
  • 配置場所: ドメインルート直下(https://example.com/robots.txt
  • AI 拒否: User-agent: GPTBot -> Disallow: /
  • 生成ツール: 下のコンポーネントで即座に設定ファイルを出力

1. オンライン robots.txt 生成ツール

UI上で許可・拒否ルールを選択するだけで、構文エラーのない robots.txt をブラウザ内で即座に生成できます。

🤖 この場でrobots.txtを生成する

  

2. ディレクティブ(記述ルール)の役割

ディレクティブ役割記述例
User-agent:クローラーの種類を指定(* は全クローラー対象)User-agent: Googlebot
Disallow:クロールを禁止するパス(URL空間)を指定Disallow: /admin/
Allow:禁止パスの中で特定サブディレクトリのみ許可Allow: /admin/public/
Sitemap:XMLサイトマップの絶対URLを指定Sitemap: https://example.com/sitemap.xml

3. 実務でよく使う robots.txt 設定パターン集

① 標準的なWebサイト設定(全体許可 + 管理画面拒否)

User-agent: *
Disallow: /admin/
Disallow: /api/
Disallow: /search
Disallow: /*?* # クエリパラメータ付きURLのクロール抑制

Sitemap: https://example.com/sitemap.xml

② AI 学習クローラー(GPTBot / ClaudeBot)のみを拒否する設定

User-agent: *
Disallow: /admin/

# OpenAI の学習ボットを拒否
User-agent: GPTBot
Disallow: /

# Anthropic の学習ボットを拒否
User-agent: ClaudeBot
Disallow: /

Sitemap: https://example.com/sitemap.xml

4. robots.txt 运用の注意点

  1. robots.txt は非公開の秘匿手段ではない: ファイル自体は誰でもアクセス可能(https://example.com/robots.txt)なため、非公開ページや秘密のパスを Disallow に書くと逆に存在が露見します。
  2. インデックス防止には noindex を使用する: 既にインデックスされたページを検索結果から完全に消すには、robots.txt で遮断するのではなく、HTML <meta name="robots" content="noindex"> ヘッダーを使用します。