データ取り込み
実世界のコンテンツをエージェントが扱える形に変換する処理。クロール、スクレイピング、PDF解析、ドキュメントの正規化などが含まれます。
3件
JavaScriptをレンダリングし、リンクを辿り、検索コーパスを汚染しがちなナビゲーションや定型部分を除去します。RAGの地味なほうの半分をきちんと解決してくれます。AGPLライセンスのため、サービスとして公開する計画がある場合は条項の確認が必要です。
ホスティング型クローラと同じ役割を、寛容なライセンスのセルフホストで果たします。抽出戦略をサイトごとに定義できます。サービスではなくライブラリであるため、プロキシの扱いやレート制限は自分で設計・管理することになります。
Googleが自ら書いた運用知識を100件超のskillディレクトリに収めたリポジトリで、`npx skills add google/skills`から必要なものだけを選んで導入します。中心は`skills/cloud`で、GKEやBigQuery、Agent Platform、Well-Architected Frameworkの6つの柱までを扱い、`skills/ads`と`skills/analytics`にはGoogle Ads API、Google Mobile Ads SDK、IMA SDK、Google Analyticsの2種類のAPI向けのskillが並びます。厚みは一様ではなく、`skills/cloud/gke-*`だけで29件を占める一方、Cloud RunとFirebaseは各1件にとどまり、README自身がactive developmentの段階だと断っています。Google Cloudも広告・アナリティクス製品も使わない構成には得るものがなく、アプリ開発側の守備範囲もGoogle Mobile Ads SDKまでで、Android・Flutter・Dart・Genkit・ADKのskillはREADMEがリンクを張るだけの別リポジトリにあります。