コンピュータ操作
ユーザーに代わってブラウザやデスクトップを操作するツール。分かれ目は、構造化された要素を扱うか生のピクセルを扱うかです。利用可能なDOMがある場面では前者が明確に安定します。
3件
スクリーンショットからクリック座標を推測させるのではなく、ページ上の操作可能な要素を抽出して構造化リストとしてモデルに渡します。この方式により、フォーム入力やスクレイピングでの安定性が明確に高くなります。一方でcanvas主体のアプリケーションや、bot対策の強いサイトでは読み取れるDOMが存在せず、精度が落ちます。
MIT109k+32
手順が分かっている部分は決定論的なPlaywrightで書き、ページの構造が予測できない箇所だけ自然言語に切り替えられます。この混在方式が現実的な中間解です。完全にAI任せの自動化は遅く不安定であり、完全にスクリプト化した自動化は画面刷新のたびに壊れます。
公式MIT23.9k+1
画像認識とDOM解析を組み合わせることで、サイトが刷新されてもフローが動き続けます。これは従来のセレクタ依存スクリプトを壊してきた典型的な失敗要因です。ライセンスがAGPLである点に注意してください。ネットワークサービスとして提供する予定がある場合は、実装に着手する前に条項を確認する必要があります。
公式AGPL-3.022.8k