リソース

From Our ブログ

Product updates, practical guides, and clear analysis for teams putting business AI to work.

最新の

最新の AI 記事

134 記事

GPT-4oミニ:知っておくべきこと
  • アーティフィシャル・インテリジェンス

GPT-4oミニ:知っておくべきこと

GPT-4oミニの紹介 2024年7月18日、オープンアイは、堅牢なGPT-4oモデルのコンパクトでコスト効率に優れたGPT4o Miniを発表した。 この新しいAIモデルは、効率的で経済的なAIソリューションを必要とする開発者や消費者をターゲットに、スピードと価格の向上を実現するよう設計されている。 GPT4o Miniは、顧客サービスのチャットボットやリアルタイムのテキスト応答など、より幅広い用途でより身近で手頃なものにすることで、高度なAI技術へのアクセスを民主化することを目指している。 OpenAIのGPT4o Mini APIを通じて利用可能なGPT4o Miniは、ChatGPTのウェブとモバイルアプリにも統合されており、翌週には企業向けアクセスも開始される予定です。 このモデルの主な特徴は、テキストとビジョンの入出力のサポート、128,000トークンのコンテキストウィンドウ、2023年10月の知識カットオフなどである。 この汎用性の高いAIモデルは、GPT-3.5ターボに取って代わる態勢を整えており、大量かつ単純なAI駆動タスクに適した選択肢として位置づけられている。 パフォーマンスとベンチマーク達成 GPT4oミニは、文字と視覚の両方を含む推論タスクで卓越した性能を発揮します。 このコンパクトなモデルは、既存の小型AIモデルの能力を凌駕するよう綿密に設計されている。 例えば、Gemini 1.5 FlashとClaude 3 Haikuがそれぞれ79%と75%であったのに対し、GPT4o MiniはMassive Multitask Language Understanding (MMLU)ベンチマークで82%という驚異的なスコアを達成した。 GPT4o Miniは、テキストや視覚のタスクだけでなく、数学的推論にも優れています。 MGSMベンチマークでは87%という驚異的なスコアを記録し、小型AIモデルの領域での優位性をさらに確立した。 これらの成果は、このモデルの堅牢性と、AI主導のアプリケーションにおける新たな基準を打ち立てる可能性を強調している。 GPT-4oミニのコスト効率と価格 GPT4oミニの最も魅力的な特徴の一つは、そのコスト効率である。 価格は入力トークン100万個あたり15セント、出力トークン100万個あたり60セントで、前身のGPT-3.5ターボより60%以上安い。 この大幅なコスト削減は、AIソリューションへの支出の最適化を目指す開発者や企業にとって魅力的な選択肢となる。 GPT4o Miniの手頃な価格は、様々なAIアプリケーションに大きな影響を与える。 カスタマー・サポートのチャットボットからリアルタイムのテキスト応答まで、コストの障壁を下げることで、既存プロジェクトと新規プロジェクトの両方で幅広い導入が可能になる。 これにより、中小企業や新興企業は、従来はコスト的に困難であった高度なAI技術を活用できるようになり、最先端のAIへのアクセスが民主化される。 こうしたコスト削減の恩恵を大きく受ける可能性のあるユースケースには、自動化されたカスタマーサービス、ダイナミックなコンテンツ生成、リアルタイムのデータ分析などがある。 高度なAIをより身近なものにすることで、OpenAIはAIが様々なアプリケーションやデジタル体験のシームレスな一部となる未来への道を切り開こうとしている。 技術仕様と能力 GPT4oミニは、テキストやビジョンを含む幅広い入出力をサポートしています。 この汎用性により、開発者は複数の種類のデータを扱うことができる多様なアプリケーションを作成することができる。 さらに、OpenAIは将来のアップデートで、これらの機能をビデオやオーディオの入出力に拡張し、マルチメディア文脈でのモデルの使い勝手を向上させる予定です。 GPT4oミニのもう一つの主な特徴は、最大128,000トークンをサポートする広範なコンテキストウィンドウです。 これにより、このモデルは大規模なデータセットを効率的に管理することができ、包括的なデータ分析を必要とするアプリケーションに最適です。 さらに、このモデルの知識のカットオフは2023年10月に設定されており、世界の比較的最近の理解で動作するようになっている。 これらの技術仕様により、GPT4o Miniは高度なAIアプリケーションのための堅牢なツールとなっている。 安全・セキュリティ対策 OpenAIはGPT4o Miniに強固な安全・セキュリティ対策を導入し、保護と信頼性を強化している。… Read more »

記事を読む
Claude AI 3.5 Sonnet
  • アーティフィシャル・インテリジェンス

AnthropicのClaude 3.5 Sonnet LLMがリリース:GPT-4oより優れている?

クロード3.5ソネットLLMは、大規模言語モデル(LLM)のクロード3.5ファミリーの最新モデルです。 2024年3月にAnthropic社から発表され、大きな飛躍を遂げた。 このモデルは、GPT-4oやGemini 1.5 Proのような先代モデルや注目すべきライバルを凌駕している。 Claude 3.5 Sonnet LLMは、パフォーマンス、コストパフォーマンス、汎用性において新たなベンチマークを打ち立てました。 さまざまな領域で優れているため、さまざまな業界や用途で価値あるツールとなっている。 算数、推論、コーディング、多言語タスクにおけるその高度な能力は、他の追随を許さない。 このモデルは、業界標準の指標でトップスコアを達成している。 大学院レベルのQ&A(GPQA)では5ショット設定で67.2%、一般推論(MMLU)では驚異的な90.4%、Pythonコーディング(HumanEval)では驚異的な92.0%を記録している。 クロード3.5ソネットLLMのパフォーマンスは? 5発セッティングのGPQA(Graduate Level Q&A)で、クロード3.5ソネットは67.2%という素晴らしいスコアを出した。 この指標は、モデルが大学院レベルの質問を理解し、回答する能力を評価するもので、高度な理解と推論能力を示している。 一般推論(MMLU)では、90.4%という驚異的な数値を記録し、論理的推論と問題解決タスクにおいて高いパフォーマンスを発揮した。 Claude 3.5 SonnetはPythonコーディングに秀でており、HumanEvalベンチマークで92.0%のスコアを達成。 これは、Pythonコードの記述と理解に精通していることを示しており、開発者やエンジニアにとって非常に貴重なツールとなっている。 このモデルは、前モデルであるクロード3オーパスの2倍の速度で情報を処理できるため、複雑なタスクや複数ステップのワークフローを処理する効率が大幅に向上している。 この迅速な処理能力は、金融や医療など、迅速な意思決定が求められる業界にとって特に有益である。 さらに、クロード3.5ソネットは提示されたコーディング問題の64%を解決できるのに対し、クロード3オーパスは38%。 この大幅な改良は、その高度なコーディング能力を際立たせ、ソフトウェア開発、コードメンテナンス、さらにはコード翻訳のための強力なツールとなっている。 クロード3.5ソネットのビジョン能力については? Claude 3.5 Sonnetは、視覚的推論タスクにおいて優れた性能を発揮し、他の大規模言語モデル(LLM)とは一線を画している。 この高度な機能により、モデルは視覚データを驚くほど正確に解釈し、分析することができる。 複雑なチャート、グラフ、その他の視覚的表現の解読にかかわらず、Claude 3.5 Sonnetは意思決定プロセスを推進する意味のある洞察の抽出に優れています。 この熟練度は、トレンド、パターン、異常を理解するために視覚情報が重要なシナリオで特に有益である。 チャートやグラフを正確に解釈するこのモデルの能力は、データの視覚化に大きく依存する業界にとって画期的なものだ。 例えば、金融セクターでは、アナリストはクロード3.5ソネットを活用して、市場動向や財務報告を迅速かつ正確に解釈することができます。 同様に、ロジスティクスにおいても、このモデルは、視覚的な形式で提示された複雑なロジスティクス・データを分析・解釈することで、サプライチェーン・オペレーションを最適化するのに役立つ。 追加機能と強化 クロード3.5 Sonnet LLMは、データ管理に革命を起こすべく、アーティファクトと呼ばれる画期的な機能を導入。 アーティファクトは、ユーザーがデータをより効率的に保存、管理、検索できるようにし、チームや組織内でのコラボレーションを強化し、知識を一元化する環境を促進する。 この機能は、データの完全性とアクセシビリティが最優先される大規模プロジェクトに特に有益である。 Artifactsを活用することで、チームは重要な情報が一貫して利用可能で、簡単にアクセスできるようになり、ワークフローにおけるクロードのスムーズな統合が促進されます。 セキュリティと今後の展開 Claude 3.5 Sonnet LLMは、ASL-2標準に準拠し、セキュリティとプライバシーに重点を置いて設計されています。 このコンプライアンスにより、このモデルはユーザーデータを保護するための厳格なガイドラインを満たしていることが保証され、金融、医療、政府部門など、データセキュリティが最重要視される業界にとって信頼できる選択肢となっている。 これらの基準を遵守することは、機密情報を保護するだけでなく、高いセキュリティ・プロトコルを維持するというコミットメントを示すことによって、ユーザーや利害関係者の信頼を築くことにもなる。 サイバー脅威がますます巧妙化する中、このような厳格なコンプライアンスの重要性はいくら強調してもしすぎることはない。 今後、Anthropicは、HaikuとOpusを含む新しいモデルでクロード3.5ファミリーを拡大する野心的な計画を持っています。… Read more »

記事を読む
RAG-as-a-Service:あなたのビジネスにジェネレーティブAIを
  • AIナレッジベース

RAG-as-a-Service:あなたのビジネスにジェネレーティブAIを

大規模言語モデル(LLM)とジェネレーティブAIのトレンドの台頭により、ジェネレーティブAIソリューションをビジネスに統合することで、ワークフローの効率を大幅に向上させることができます。 初めてジェネレーティブAIに触れる人は、専門用語の多さに戸惑うかもしれない。 このブログでは、ジェネレーティブAIの基本的な用語について説明し、RAG-as-a-Serviceを使用してビジネスのためのカスタムAIソリューションを開始する方法について説明します。 検索拡張世代(RAG)とは? Retrieval Augmented Generation(RAG)は、LLMや生成AIをビジネス・ワークフローに導入する際の重要なコンセプトである。 RAGは、事前にトレーニングされたTransformerモデルを活用し、特定の知識ベースから関連するデータをクエリプロセスに注入することで、ビジネス関連のクエリに回答します。 LLMが訓練を受けていない可能性のあるこのデータは、正確で適切な回答を生成するために使用される。 RAGは費用対効果が高く効率的であるため、ジェネレーティブAIをより身近なものにする。 RAGに関連する重要な用語をいくつか探ってみよう。 RAGの主要用語 チャンキング LLMはリソースを必要とし、「コンテキスト・ウィンドウ」と呼ばれる管理可能なデータ長で学習される。コンテキスト・ウィンドウは使用するLLMによって異なる。 その限界に対処するため、文書やテキスト文献として提供されるビジネスデータは、より小さな塊にセグメント化される。 これらのチャンクは、クエリー検索プロセスで利用される。 チャンクは非構造化であり、クエリは知識ベースデータと構文的に異なる可能性があるため、チャンクはセマンティック検索を使って検索される。 ベクター・データベース Pinecone、Chromadb、FAISSのようなベクターデータベースは、ビジネスデータの埋め込みを保存する。 エンベッディングは、テキストデータをその意味に基づいて数値化し、意味的に類似したデータが近接する高次元ベクトル空間に格納される。 ユーザーによるクエリが行われると、そのクエリの埋め込みがベクトル・データベース内の意味的に類似したチャンクを見つけるために使われる。 RAGアズ・ア・サービス 技術的な専門知識がない場合、RAGをビジネスに導入するのは大変なことです。 そこでRAG-as-a-Service(RaaS)が登場する。 私たちmeetcody.aiは、お客様のビジネスニーズに合わせたプラグアンドプレイのソリューションを提供します。 アカウントを作成するだけで、無料でご利用いただけます。 チャンキング、ベクター・データベース、そしてRAGの全プロセスを私たちが行いますので、ご安心ください。 よくあるご質問 1.RAG-as-a-Service(RaaS)とは何ですか? RAG-as-a-Service(RaaS)は、お客様のビジネスのための検索拡張世代プロセス全体を処理する包括的なソリューションです。 これには、データのチャンキング、埋め込みデータのベクトルデータベースへの格納、クエリに関連するデータを検索するためのセマンティック検索の管理などが含まれる。 2.チャンキングはRAGプロセスにどのように役立ちますか? チャンキングは、大きなビジネス文書を、LLMのコンテキスト・ウィンドウに収まるように、管理しやすい小さな断片に分割します。 このセグメンテーションにより、LLMはセマンティック検索を使って関連情報をより効率的に処理し、取り出すことができる。 3.ベクター・データベースとは何か? ベクターデータベースは、ビジネスデータの数値表現(埋め込み)を保存します。 これらの埋め込みは、クエリが行われたときに、意味的に類似したデータを効率的に検索することを可能にし、LLMからの正確で適切な応答を保証する。 RAG-as-a-Serviceのパワーを活用することで、RAGを簡単かつ効率的にお客様のビジネスに統合することができます。 今すぐmeetcody.aiを使い始め、高度なジェネレーティブAIソリューションでワークフローを変革しましょう。

記事を読む
Anthropicのツールとクロード3でタスクを自動化するには?
  • AIツール

Anthropicのツールとクロード3でタスクを自動化するには?

Anthropicのツールを使い始める LLMを業務に採用する最大のメリットは、その汎用性にある。 LLMは、テキスト生成のためのAPIとして機能したり、非構造化データを整理されたフォーマットに変換したりと、無数の目的を果たすために特定の方法でプロンプトを出すことができる。 電子メールを作成したり、AIとおちゃらけた討論をしたりと、私たちの多くは日常業務でChatGPTを利用している。 GPT」とも呼ばれるプラグインのアーキテクチャは、レスポンスやクエリからキーワードを特定し、関連する機能を実行することを中心に展開される。 これらのプラグインは、外部アプリケーションとのインタラクションやカスタム機能のトリガーを可能にする。 OpenAIがタスク実行のための外部関数呼び出しを可能にする方法を先導したのに対し、Anthropicは最近、以前の関数呼び出しメカニズムに代わって「ツール使用」と呼ばれる拡張機能を導入した。 この更新版では、XMLタグの代わりにJSONを利用することで、開発を簡素化している。 さらに、Claude-3 OpusはGPTモデルよりも大きな20万トークンのコンテクスト・ウィンドウを持ち、特定のシナリオで特に価値を発揮する。 このブログでは、「ツール使用」のコンセプトを探求し、その特徴について説明し、始めるためのガイダンスを提供します。 道具の使用」とは何か? クロードは、外部のクライアントサイドのツールや関数と相互作用する機能を備えており、クロードに独自のカスタムツールを装備して、より幅広い作業を行うことができます。 クロードでツールを使うワークフローは以下の通り: クロードにツールとユーザープロンプトを提供する(APIリクエスト) クロードが選択できるように、一連のツールを定義する。 テキスト生成プロンプトに、ユーザークエリとともにそれらを含める。 クロードが道具を選ぶ クロードは、ユーザーのプロンプトを分析し、利用可能なすべてのツールと比較して、最も適切なものを選択します。 LLMの「思考」プロセスを活用し、関連ツールに必要なキーワードを特定する。 レスポンス生成(APIレスポンス) プロセスが完了すると、選択されたツールおよびパラメータとともに、思考プロンプトが出力として生成される。 このプロセスに続いて、選択した関数/ツールを実行し、必要であればその出力を利用して別の応答を生成する。 ツールの一般的なスキーマ このスキーマは、関数呼び出しプロセスの要件をLLMに伝える手段として機能する。 直接関数を呼び出したり、自らアクションを起こしたりすることはない。 道具の正確な識別を確実にするため、各道具の詳細な説明を提供しなければならない。 Properties スキーマ内のパラメータは、後の段階で関数に渡されるパラメータを特定するために利用される。 デモンストレーション ウェブをスクレイピングして、あらゆる銘柄の価格を見つけるツールを作ってみよう。 ツール・スキーマ scrape_website ツールでは、ユーザー・プロンプトからウェブサイトのURLを取得する。 stock_price ツールに関しては、ユーザー・プロンプトから会社名を特定し、yfinanceのティッカーに変換する。 ユーザープロンプト ボットに2つのクエリ(各ツールに1つずつ)を尋ねると、次のような出力が得られる: この思考プロセスには、LLMが各クエリに適したツールを正確に選択し、ツールの説明にあるように必要な変換を実行するためのすべてのステップが記載されている。 関連ツールの選択 条件に基づいて関連関数をトリガーするコードを追加で書かなければならない。 この関数は、LLMレスポンスで取得されたツール名に基づいて適切なコードをアクティブにする役割を果たす。 最初の条件では、Tool入力から取得したウェブサイトのURLをスクレイピングし、2番目の条件では、株式ティッカーを取得し、yfinance pythonライブラリに渡します。 関数の実行 select_tool() 関数にToolUseBlock 全体を渡して、関連するコードをトリガーする。 出力 最初のプロンプト 第2プロンプト このデモのソースコード全体をご覧になりたい場合は、このノートブックをご覧ください。 使用例 クロードの「ツール使用」機能は、LLMの多用途性をまったく新しいレベルに引き上げている。 提供された例は基本的なものであるが、これは機能を拡張するための基礎となるものである。… Read more »

記事を読む
2024年にチェックすべきトップ・ハグリング・フェイス・スペース
  • AIツール

2024年にチェックすべきトップ・ハグリング・フェイス・スペース

Hugging Faceは、NLP、コンピュータ・ビジョン、そしてそれ以上のための広範なツールとモデルのスイートを誇り、機械学習コミュニティですぐに利用されるプラットフォームとなった。 最も人気のあるサービスのひとつは、開発者が機械学習アプリケーションやデモを共有できる共同プラットフォーム「Hugging Face Spaces」だ。 これらの「スペース」では、ユーザーがモデルと直接対話することができ、最先端のAI技術を実際に体験することができる。 この記事では、2024年にチェックすべき注目のハギング・フェイス・スペースを5つ紹介する。 これらのスペースはそれぞれ、今日のAIモデルの巨大なパワーを活用するユニークなツールやジェネレーターを提供している。 詳細を掘り下げてみよう。 エピックリアリズムXL Epicrealismxlは、stablediffusion epicrealism-xlモデルを使用した最先端のテキストから画像へのジェネレーターです。 このスペースでは、息継ぎ画像を生成するためのプロンプト、ネガティブプロンプト、サンプリングステップをアプリケーションに提供することができます。 インスピレーションを求めるアーティストにも、ビジュアルを求めるマーケティング担当者にも、epicrealismxlは、壮大であると同時にリアルな高品質の画像生成を提供します。 ポッドキャスティファイ Podcastifyは、記事をリスニング可能なオーディオポッドキャストに変換することで、あなたが書かれたコンテンツを消費する方法に革命を起こします。 変換したい記事のURLをテキストボックスに貼り付け、「Podcastify」をクリックするだけ! 生成されたばかりのポッドキャストは、会話タブで聴いたり見たりすることができます。 このツールは、聴覚学習を好むマルチタスクの人や、外出中の人に最適です。 ダレ-3-xl-lora-v2 dalle-3-xl-lora-v2もまた、悪名高いDALL-E 3モデルを利用したテキストから画像へのジェネレーターである。 epicrealismxlと似た機能を持つこのツールは、テキストプロンプトから画像を生成することができます。 DALL-E 3はその多様性と創造性で知られており、様々な用途で複雑でユニークなビジュアルを生成するのに最適な選択肢です。 AIウェブスクレーパー AI Scraperは、コーディングスキルを必要とせずに、高度なウェブスクレイピング機能をあなたの指先にもたらします。 このコード不要のツールは、Hugging Face Hubにホストされている高度なAIモデルを使用して、ウェブコンテンツを簡単にスクレイピングして要約することができます。 ご希望のプロンプトとソースURLを入力すると、JSON形式で有用な情報の抽出が開始されます。 このツールは、ジャーナリスト、研究者、コンテンツ制作者にとって不可欠なものだ。 AI QRコードジェネレーター AI QRコードジェネレーターは、あなたのQRコードを全く新しい芸術的レベルに引き上げます。 QRコード画像を初期画像とコントロール画像の両方に使用することで、このツールは提供されたプロンプトに自然に溶け込むQRコードを生成することができます。 ストレングス&コンディショニングスケールのパラメーターを調整し、機能的で美しいQRコードを作成します。 結論 ハギング・フェイス・スペースは、機械学習とAIの急速な進歩を証明するものだ。 あなたがアーティストであれ、コンテンツクリエイターであれ、マーケターであれ、あるいは単なるAI愛好家であれ、これらのトップ5のスペースは、あなたのワークフローを強化し、創造性に火をつけることができる様々なツールやジェネレーターを提供している。 2024年に時代を先取りするために、これらのスペースをぜひ探索してほしい。 2024年のオープンソースLLMトップ5について知りたい方は、こちらのブログをお読みください。

記事を読む
ジェミニ1.5フラッシュ vs GPT-4o:GPT-4oに対するグーグルの対応?
  • アーティフィシャル・インテリジェンス

ジェミニ1.5フラッシュ vs GPT-4o:GPT-4oに対するグーグルの対応?

AI競争は激化し、ハイテク業界の大手企業同士のキャッチボールになっている。 グーグルI/Oの直前にGPT-4oが発表されたのは偶然ではない。 GPT-4oのマルチモーダリティ、正確にはオムニモーダリティにおける驚異的な能力は、ジェネレーティブAIコンペティションに大きなインパクトを与えた。 しかし、グーグルは決して手をこまねいているわけではない。 Google I/O期間中、GeminiとGemmaの新モデルが発表された。 発表されたすべてのモデルの中で、ジェミニ1.5フラッシュは最もインパクトのあるモデルとして際立っている。 このブログでは、ジェミニ1.5フラッシュの最大の特徴を探り、ジェミニ1.5プロとジェミニ1.5フラッシュ対GPT-4oを比較し、どちらが優れているかを判断する。 ジェミニ1.5フラッシュとGPT-4oの比較 グーグルが発表したベンチマークスコアによると、ジェミニ1.5フラッシュは、グーグルが発表した他のすべてのLLMと比較して、オーディオで優れた性能を発揮し、他のベンチマークでは、現行モデルのジェミニ1.5プロ(2024年2月)と同等である。 LLMの性能を評価するのにベンチマークに完全に頼ることはお勧めできないが、性能の差やマイナーアップグレードを定量化するのには役立つ。 部屋の中の象は、ジェミニ1.5フラッシュのコストである。 GPT-4oに比べ、ジェミニ1.5フラッシュははるかに手頃な価格だ。 コンテキスト・ウィンドウ Gemini 1.5 Proと同様に、Flashには100万トークンのコンテキストウィンドウが搭載されている。これはOpenAIのどのモデルよりも多く、プロダクショングレードのLLMとしては最大級のコンテキストウィンドウである。 コンテキストウィンドウを大きくすることで、より多くのデータを理解することができ、チャンクサイズを大きくすることで、大きな知識ベースを持つユースケースのためのRAG(Retrieval-Augmented Generation)のようなサードパーティ技術を向上させることができる。 さらに、より大きなコンテキストウィンドウは、より多くのテキストを生成することができ、記事、電子メール、プレスリリースを書くようなシナリオで役立ちます。 マルチモーダリティ ジェミニ1.5フラッシュはマルチモーダルだ。 マルチモダリティは、音声、ビデオ、文書などの形で文脈を入力することを可能にする。 マルチモーダリティを持つLLMはより汎用性が高く、前処理を必要としない生成AIのより多くの応用への扉を開く。 「Gemini 1.5モデルは、非常に長い文脈を扱うために構築されており、少なくとも10Mトークンまでの細かい情報を想起し、推論する能力を持つ。このスケールは、現代の大規模言語モデル(LLM)の中でも前例がなく、ドキュメントのコレクション全体、複数時間のビデオ、ほぼ5日分の音声を含む、長い形式の混合モダリティ入力の処理を可能にする。”- ディープマインド・レポート ダッバス=ヒンディー語で列車の客車。 マルチモーダリティと多言語パフォーマンスの実証。 また、マルチモダリティを持つことで、LLMを他の専門サービスの代用として使うこともできる。 例えば。 OCRまたはウェブスクレイピング。 ウェブページからデータを簡単にスクレイピングし、変換します。 スピード ジェミニ1.5フラッシュは、その名の通り、レスポンスタイムの点で他のモデルより優位に立つように設計されている。 前述のウェブスクレイピングの例では、レスポンスタイムに約2.5秒の差があり、これはほぼ40%高速であるため、Gemini 1.5 Flashは、オートメーション用途や低レイテンシを必要とするユースケースに適した選択肢となる。 ジェミニ1.5フラッシュの興味深い使用例 ビデオの要約 ジェミニ1.5プロのビデオ理解は、AIで最も過小評価されているものだ。 50年代には、スポーツ界で最も象徴的な瞬間の11分のYoutubeビデオ(~175kトークン)を「見て」、(私の知る限り)18の瞬間を完璧にリストアップすることができた。 こんなにいいビデオAIは他にない!pic.twitter.com/LaVGR3ATfU– ディーディー (@deedydas)April 5, 2024 ビデオを使ってコードを書く これは衝撃的だ᤯。 Geminiに1.5Flashで録画した私の買い物のビデオを渡すと、Seleniumコードを5秒で表示してくれた。 これは多くのことを変えることができるpic.twitter.com/Ojm6aueLe7– Min Choi (@minchoi)2024年5月18日 ゲームプレイの自動化… Read more »

記事を読む

最初のアシスタントは数分の距離にあります

ビジネス知識を活用しましょう。

無料の Cody アカウントから始めてください。コンテンツを追加し、アシスタントを構築し、最初の役立つ回答を今すぐ共有してください。