• AIツール

Anthropicのツールとクロード3でタスクを自動化するには?

Anthropicのツールを使い始める LLMを業務に採用する最大のメリットは、その汎用性にある。 LLMは、テキスト生成のためのAPIとして機能したり、非構造化データを整理されたフォーマットに変換したりと、無数の目的を果たすために特定の方法でプロンプトを出すことができる。 電子メールを作成したり、AIとおちゃらけた討論をしたりと、私たちの多くは日常業務でChatGPTを利用している。 GPT」とも呼ばれるプラグインのアーキテクチャは、レスポンスやクエリからキーワードを特定し、関連する機能を実行することを中心に展開される。 これらのプラグインは、外部アプリケーションとのインタラクションやカスタム機能のトリガーを可能にする。 OpenAIがタスク実行のための外部関数呼び出しを可能にする方法を先導したのに対し、Anthropicは最近、以前の関数呼び出しメカニズムに代わって「ツール使用」と呼ばれる拡張機能を導入した。 この更新版では、XMLタグの代わりにJSONを利用することで、開発を簡素化している。 さらに、Claude-3 OpusはGPTモデルよりも大きな20万トークンのコンテクスト・ウィンドウを持ち、特定のシナリオで特に価値を発揮する。 このブログでは、「ツール使用」のコンセプトを探求し、その特徴について説明し、始めるためのガイダンスを提供します。 道具の使用」とは何か? クロードは、外部のクライアントサイドのツールや関数と相互作用する機能を備えており、クロードに独自のカスタムツールを装備して、より幅広い作業を行うことができます。 クロードでツールを使うワークフローは以下の通り: クロードにツールとユーザープロンプトを提供する(APIリクエスト) クロードが選択できるように、一連のツールを定義する。 テキスト生成プロンプトに、ユーザークエリとともにそれらを含める。 クロードが道具を選ぶ クロードは、ユーザーのプロンプトを分析し、利用可能なすべてのツールと比較して、最も適切なものを選択します。 LLMの「思考」プロセスを活用し、関連ツールに必要なキーワードを特定する。 レスポンス生成(APIレスポンス) プロセスが完了すると、選択されたツールおよびパラメータとともに、思考プロンプトが出力として生成される。 このプロセスに続いて、選択した関数/ツールを実行し、必要であればその出力を利用して別の応答を生成する。 ツールの一般的なスキーマ このスキーマは、関数呼び出しプロセスの要件をLLMに伝える手段として機能する。 直接関数を呼び出したり、自らアクションを起こしたりすることはない。 道具の正確な識別を確実にするため、各道具の詳細な説明を提供しなければならない。 Properties スキーマ内のパラメータは、後の段階で関数に渡されるパラメータを特定するために利用される。 デモンストレーション ウェブをスクレイピングして、あらゆる銘柄の価格を見つけるツールを作ってみよう。 ツール・スキーマ scrape_website ツールでは、ユーザー・プロンプトからウェブサイトのURLを取得する。 stock_price ツールに関しては、ユーザー・プロンプトから会社名を特定し、yfinanceのティッカーに変換する。 ユーザープロンプト ボットに2つのクエリ(各ツールに1つずつ)を尋ねると、次のような出力が得られる: この思考プロセスには、LLMが各クエリに適したツールを正確に選択し、ツールの説明にあるように必要な変換を実行するためのすべてのステップが記載されている。 関連ツールの選択 条件に基づいて関連関数をトリガーするコードを追加で書かなければならない。 この関数は、LLMレスポンスで取得されたツール名に基づいて適切なコードをアクティブにする役割を果たす。 最初の条件では、Tool入力から取得したウェブサイトのURLをスクレイピングし、2番目の条件では、株式ティッカーを取得し、yfinance pythonライブラリに渡します。 関数の実行 select_tool() 関数にToolUseBlock 全体を渡して、関連するコードをトリガーする。 出力 最初のプロンプト 第2プロンプト このデモのソースコード全体をご覧になりたい場合は、このノートブックをご覧ください。 使用例 クロードの「ツール使用」機能は、LLMの多用途性をまったく新しいレベルに引き上げている。 提供された例は基本的なものであるが、これは機能を拡張するための基礎となるものである。… Read more »

によって Om Kamath読書時間: 1
Anthropicのツールとクロード3でタスクを自動化するには?

Anthropicのツールを使い始める

LLMを業務に採用する最大のメリットは、その汎用性にある。 LLMは、テキスト生成のためのAPIとして機能したり、非構造化データを整理されたフォーマットに変換したりと、無数の目的を果たすために特定の方法でプロンプトを出すことができる。 電子メールを作成したり、AIとおちゃらけた討論をしたりと、私たちの多くは日常業務でChatGPTを利用している。

GPT」とも呼ばれるプラグインのアーキテクチャは、レスポンスやクエリからキーワードを特定し、関連する機能を実行することを中心に展開される。 これらのプラグインは、外部アプリケーションとのインタラクションやカスタム機能のトリガーを可能にする。

OpenAIがタスク実行のための外部関数呼び出しを可能にする方法を先導したのに対し、Anthropicは最近、以前の関数呼び出しメカニズムに代わって「ツール使用」と呼ばれる拡張機能を導入した。 この更新版では、XMLタグの代わりにJSONを利用することで、開発を簡素化している。 さらに、Claude-3 OpusはGPTモデルよりも大きな20万トークンのコンテクスト・ウィンドウを持ち、特定のシナリオで特に価値を発揮する。

このブログでは、「ツール使用」のコンセプトを探求し、その特徴について説明し、始めるためのガイダンスを提供します。

道具の使用」とは何か?

クロードは、外部のクライアントサイドのツールや関数と相互作用する機能を備えており、クロードに独自のカスタムツールを装備して、より幅広い作業を行うことができます。

クロードでツールを使うワークフローは以下の通り:

  1. クロードにツールとユーザープロンプトを提供する(APIリクエスト)
    • クロードが選択できるように、一連のツールを定義する。
    • テキスト生成プロンプトに、ユーザークエリとともにそれらを含める。
  2. クロードが道具を選ぶ
    • クロードは、ユーザーのプロンプトを分析し、利用可能なすべてのツールと比較して、最も適切なものを選択します。
    • LLMの「思考」プロセスを活用し、関連ツールに必要なキーワードを特定する。
  3. レスポンス生成(APIレスポンス)
    • プロセスが完了すると、選択されたツールおよびパラメータとともに、思考プロンプトが出力として生成される。

このプロセスに続いて、選択した関数/ツールを実行し、必要であればその出力を利用して別の応答を生成する。

ツールの一般的なスキーマ

スキーマ
このスキーマは、関数呼び出しプロセスの要件をLLMに伝える手段として機能する。 直接関数を呼び出したり、自らアクションを起こしたりすることはない。 道具の正確な識別を確実にするため、各道具の詳細な説明を提供しなければならない。 Properties スキーマ内のパラメータは、後の段階で関数に渡されるパラメータを特定するために利用される。

デモンストレーション

ウェブをスクレイピングして、あらゆる銘柄の価格を見つけるツールを作ってみよう。

ツール・スキーマ

コード1

scrape_website ツールでは、ユーザー・プロンプトからウェブサイトのURLを取得する。 stock_price ツールに関しては、ユーザー・プロンプトから会社名を特定し、yfinanceのティッカーに変換する。

ユーザープロンプト

コード2

ボットに2つのクエリ(各ツールに1つずつ)を尋ねると、次のような出力が得られる:

コード3

この思考プロセスには、LLMが各クエリに適したツールを正確に選択し、ツールの説明にあるように必要な変換を実行するためのすべてのステップが記載されている。

関連ツールの選択

条件に基づいて関連関数をトリガーするコードを追加で書かなければならない。

コード4

この関数は、LLMレスポンスで取得されたツール名に基づいて適切なコードをアクティブにする役割を果たす。 最初の条件では、Tool入力から取得したウェブサイトのURLをスクレイピングし、2番目の条件では、株式ティッカーを取得し、yfinance pythonライブラリに渡します。

関数の実行

select_tool() 関数にToolUseBlock 全体を渡して、関連するコードをトリガーする。

出力

  1. 最初のプロンプトコード5
  2. 第2プロンプトコード4

このデモのソースコード全体をご覧になりたい場合は、このノートブックをご覧ください。

使用例

クロードの「ツール使用」機能は、LLMの多用途性をまったく新しいレベルに引き上げている。 提供された例は基本的なものであるが、これは機能を拡張するための基礎となるものである。 その実際の応用例をひとつ紹介しよう:

より多くの使用例を見つけるには、Anthropicの公式リポジトリをご覧ください。
をご覧ください。
.

探索を続けてください

関連記事

Gemini Embedding 2:グーグル初のマルチモーダル埋め込みモデル
  • AIツール

Gemini Embedding 2:グーグル初のマルチモーダル埋め込みモデル

Gemini Embedding 2:機能、ベンチマーク、価格、開始方法 先週、グーグルは ジェミニ エンベッディング2は、Geminiアーキテクチャ上に構築された初のネイティブなマルチモーダルエンベッディングモデルである。エンベッディングを何らかの形で扱うのであれば、これは注目に値する。これは、今日ほとんどのチームが依存しているマルチモデルのエンベッディングパイプラインを大きく破壊する可能性を秘めています。 これまで、OpenAI、Cohere、Voyageの主要な埋め込みモデルは、主にテキストベースでした。画像とテキストのアライメントにはCLIP、画像とビデオにはVoyage Multimodal 3.5など、いくつかのマルチモーダル・オプションは存在しましたが、単一の統一されたベクトル空間で、あらゆるモダリティをカバーするものはありませんでした。音声は通常、埋め込む前に書き起こす必要があった。ビデオでは、フレーム抽出と個別のトランスクリプト埋め込みが必要でした。画像は、完全に独自のベクトル空間に存在していました。 Gemini Embedding 2はその方程式を変える。1つのモデル、1つのAPIコール、1つのベクトル空間。 新情報を掘り下げてみよう。 Gemini Embedding 2とは何ですか? Gemini Embedding 2(gemini-embedding-2-preview) は、Google DeepMind初の完全なマルチモーダル埋め込みモデルである。テキスト、画像、ビデオクリップ、音声記録、PDF文書を取り込み、それらすべてを同じ共有意味空間に存在するベクトルに変換する。 CLIPのような以前のマルチモーダルアプローチは、ビジョンエンコーダとテキストエンコーダをペアにして、最後に対比学習でそれらを調整するものであったが、Gemini Embedding 2は、Geminiの基礎モデルそのものに基づいて構築されている。これは、深いクロスモーダル理解を基礎から受け継いでいることを意味する。 実例ビデオチュートリアル、オーディオレクチャー、文書によるガイドで学習管理システム(LMS)を構築しているとします。Gemini Embedding 2を使用すると、これらすべてのコンテンツのエンベッディングを単一のベクトル空間に格納し、ビデオ、オーディオ、ドキュメントから関連するチャンクを取得するRAGベースのチャットボットを構築することができます。これまでは、何層ものエンベッディングパイプラインが必要でしたが、それでも、トランスクリプトをキャプチャするだけで、ビデオのビジュアルコンテキストやスピーカーの声のトーンを逃していました。 このモデルはマトリョーシカ表現学習を使用しているため、必要なければ3072次元すべてを使用する必要はない。1536や768に縮小しても、使用可能な結果を得ることができる。 マトリョーシカ表現学習(MRL)は、学習された表現が完全な次元だけでなく、ロシアのマトリョーシカ人形のように互いに入れ子になっている様々な小さな次元でも有用であるように、埋め込みモデルを学習する手法です。学習中、損失関数は完全な埋め込みだけでなく、埋め込みベクトルの複数の接頭辞に対しても計算されます。これによりモデルは、最も重要な情報を最も初期の次元に詰め込み、それに続く各次元がより細かいディテールを追加していく、つまり粗いものから細かいものへの構造を持つようになる。 対応モダリティと入力制限 このモデルは5種類の入力を受け入れ、すべて同じ埋め込み空間にマッピングされる: モダリティ 入力制限 フォーマット テキスト 最大8,192トークン プレーンテキスト 画像 1リクエストにつき6枚まで PNG, JPEG ビデオ 最大120秒 MP4、MOV 音声 最大80秒(ネイティブ、トランスクリプションなし) MP3, WAV PDF 直接埋め込む PDFドキュメント 既存モデルとの比較 TLDR:Googleの新しいGemini Embedding 2モデルは、テキスト、画像、ビデオ、音声のほぼ全てのモダリティにおいて、競合他社(自身の前身、Amazon… Read more »

記事を読む
錯綜する彗星:エージェント検索への大胆な飛躍
  • AIツール

錯綜する彗星:エージェント検索への大胆な飛躍

AIを搭載した検索エンジンの巨人、Perplexityが最新のベンチャー企業、Cometと呼ばれる革新的なウェブ・ブラウザでテック界に波紋を広げている。Cometは「A Browser forAgenticSearch by Perplexity」と銘打たれ、競争の激しいブラウザ市場に大胆な一歩を踏み出した。デザインやリリース時期についての詳細はまだ明らかにされていないが、同社はすでにサインアップリストを立ち上げており、Cometが「間もなく登場する」ことを予告している。 この動きは、パープレクシティが大きく成長している時に行われた。90億ドルという驚異的な評価を受けている同社は、現在、検索エンジンを通じて毎週1億件以上のクエリを処理している。Cometの導入は、Perplexityがその影響力を検索以外にも拡大し、ユーザーのウェブとの関わり方を再構築する可能性があることを意味する。期待が高まる中、CometはPerplexityの拡大するデジタル・エコシステムにおいて極めて重要な要素となる準備が整っている。 コメットの主な特徴 コメットは、自律的なタスク実行を可能にする強力な機能である「エージェント検索」を活用している。つまり、ユーザーはフライトの予約や予約管理のような複雑なタスクをブラウザに委ねることができ、生産性が大幅に向上します。 Chromiumベースの基盤上に構築されたCometは、クロスプラットフォームの互換性を保証し、デスクトップとモバイルデバイス間でシームレスな体験を提供します。この設計は、確立されたブラウザ技術の安定性とPerplexityの最先端のAIイノベーションを組み合わせたものです。 深いリサーチの統合:コメットは包括的な分析ツールを提供し、ブラウザー内で直接詳細な調査を容易にします。 リアルタイムの情報処理:正確性と信頼性を保証し、出典の引用を含む最新の情報を利用できます。 豊富なアプリケーション統合:800以上のアプリケーションをサポートするCometは、ユーザーのデジタル活動の中心的なハブになることを目指しています。 従来のブラウザー機能にAIを融合させることで、Cometはユーザーのウェブとの接し方を変え、生産性と情報処理の状況を変える可能性を秘めている。Perplexityが言うように、Cometはまさに「エージェント検索のためのブラウザ」であり、インテリジェントなウェブナビゲーションの新時代を約束する。 戦略的ポジショニングと市場背景 PerplexityがCometで競争の激しいブラウザ市場に参入する際、Google Chromeのような既存プレイヤーや、The Browser CompanyのDiaのようなAIを強化した新興ブラウザからの手ごわい挑戦に直面する。しかし、高度なタスク自動化機能を備えたAI搭載のChromiumベースのブラウザというCometのユニークなポジショニングは、従来の製品とは一線を画している。 Google Chromeが膨大なユーザーベースと基本的なAI機能を誇る一方で、Cometは洗練されたAI機能、広範なアプリ統合、深いリサーチツール-すべて追加の拡張機能を必要としない-によって差別化を図ることを目指している。このアプローチは、よりインテリジェントで合理的なブラウジング体験を求めるユーザーにアピールし、特定のセグメントにおけるクロームの優位性に挑戦する可能性がある。 Perplexity社のCometのマーケティング戦略は、すでに毎週1億件以上のクエリを処理している既存の検索エンジンのユーザーベースを巧みに活用している。Perplexityは、この既存のユーザーを活用することで、Cometのスムーズな導入を促進し、競争の激しいブラウザー業界において、ユーザー獲得とエンゲージメントで大きなアドバンテージを得る可能性を狙っている。 法的および倫理的考察 パープレクシティがコメットでブラウザ市場に参入する際、同社は技術的な課題だけでなく、法的・倫理的な大きなハードルにも直面している。同社は最近、コンテンツ利用をめぐる大手出版社との法的紛争に巻き込まれている。ニューズ・コーポレーションのダウ・ジョーンズとニューヨーク・ポストはパープレクシティ社を相手取って訴訟を起こし、無許可のコンテンツ複製を非難し、同社を “コンテンツ・クレプトクラシー “とレッテルを貼った。さらに、ニューヨーク・タイムズ紙は営業停止を通告し、法的圧力をさらに強めている。 これらの疑惑に対し、パープレクシティはパブリッシャーのコンテンツを尊重していると主張し、メディア・アウトレット向けに収益分配プログラムを導入した。この動きは、懸念に対処し、コンテンツ制作者とのより協力的な関係を確立しようとする試みと思われる。しかし、このプログラムが法的紛争の解決に有効かどうかはまだわからない。 Q:AIによるウェブ閲覧の倫理的意味合いは? A: CometのようなAIを搭載したブラウザーの導入は、データプライバシーとユーザーの自律性に関する重要な倫理的問題を提起している。マーク・トンプソンなどのサイバーセキュリティ・アナリストは、AI駆動のブラウジング・ツールを使用する際に、ユーザー・データがどのように収集、処理され、共有される可能性があるかについて懸念を表明しています。Cometは、エージェント型検索や広範なアプリの統合といった機能を通じてウェブ・インタラクションに革命を起こすことを約束する一方で、透明性のあるデータ慣行と強固なプライバシー保護の必要性を増幅させている。 専門家の意見と業界の洞察 Perplexity社のCometブラウザが市場参入の準備を進める中、専門家たちがその潜在的な影響と意義について意見を交わしている。著名なAI研究者であるサラ・チェン博士は、Cometはその高度なエージェント検索機能により、ユーザーのオンライン情報への接し方を根本的に変える可能性があると指摘している。この視点は、Perplexity社の急成長と一致している。同社のAI検索エンジンは現在、毎週約1億件のクエリを処理していることからも明らかだ。 こうした懸念にもかかわらず、業界の観測筋はウェブ技術におけるAI統合の著しい成長を予測している。Perplexityの90億ドルという評価額と、AI検索エンジン分野でのトップ・コンペティターとしての位置づけは、この傾向を裏付けている。Cometは単なる新製品ではなく、イノベーションと責任あるAI実装の必要性のバランスを取りながら、インターネットをどのように認識し、どのように相互作用するかを変える可能性を示している。 これが検索を変える? 検索エンジンへのアプローチと同様に、ウェブ・ブラウジングを再発明するという同社のビジョンは、AI駆動型ブラウザが標準となる未来を示唆している。Perplexityの急速な拡大と革新的な製品の導入により、Cometはウェブ技術におけるAI統合の拡大傾向に資本参加する態勢を整えている。 ユーザーがよりインテリジェントでタスク指向のブラウジング体験に慣れるにつれ、ブラウザ市場は大きな変化を見せるかもしれない。Perplexity が Comet のエージェント型検索機能に注力することで、デジタル・インタラクションが再定義され、複雑なオンライン・タスクが効率化され、ブラウジングの習慣が再構築される可能性がある。AIがテクノロジーの様々な側面に浸透し続ける中、Cometは、ウェブブラウザがインテリジェントなアシスタントとして機能し、生産性を向上させ、デジタル世界のナビゲート方法を変革する未来に向けた大胆な一歩を表している。

記事を読む
DeepSeek R1 APIを始める:セットアップ、使用方法、および価格
  • AIツール

DeepSeek R1 APIを始める:セットアップ、使用方法、および価格

DeepSeek R1 API の紹介 DeepSeek R1 APIがAIの世界で波紋を広げている。2023年に中国・杭州の研究所が開発したこのモデルは、AIと金融に長けたエンジニア、リャン・ウェンフェンによって開発された。ChatGPT、Gemini、Claudeのようなビッグネームと同等のパフォーマンスで人気を集めている。DeepSeek R1の特徴は、そのユニークな機能の組み合わせです。競合他社の多くとは異なり、無料で無制限にアクセスできるため、開発者や研究者にとって魅力的な選択肢となっている。さらに、オープンソースであるため、ユーザーは高額なコストを負担することなくAIシステムにアクセスし、変更し、実装することができる。この費用対効果の高さにより、DeepSeek R1はAI業界のゲームチェンジャーとして、またすべての大手ハイテク企業への警鐘として位置づけられている。この革新的なモデルについて、DeepSeek R1の詳細をご覧ください。 DeepSeek R1 API のセットアップ DeepSeek R1 を使用するには、API を正しく設定する必要があります。このプロセスには、APIキーの取得と、選択したプログラミング言語用のエンドポイントの設定が含まれます。AI統合の旅を始めるために、これらの手順を説明します。 APIキーの取得と保護 DeepSeek Open Platformにアクセスし、アカウントにログインします。 サイドバーの “API Keys “セクションに移動します。 新しいAPIキーを作成し、すぐにコピーする。 APIキーは二度と表示されないので、安全に保管してください。 エンドポイントの設定とAPIコールの実行 DeepSeek R1 APIは、OpenAIのSDKと互換性があるように設計されており、さまざまなプログラミング言語を使用して簡単に統合できます。ここでは、さまざまな環境でAPIを設定し、使用する方法の例を示します: cURLの使用 簡単なテストやコマンドラインでの使用には、cURLを使うことができる: curl https://api.deepseek.com/chat/completions \ -H “Content-Type: application/json” \ -H “Authorization: Bearer <DeepSeek API Key>” \ -d ‘{ “model”: “deepseek-chat”, “messages”: [ {“role”:… Read more »

記事を読む

最初のアシスタントは数分の距離にあります

ビジネス知識を活用しましょう。

無料の Cody アカウントから始めてください。コンテンツを追加し、アシスタントを構築し、最初の役立つ回答を今すぐ共有してください。