リソース

From Our ブログ

Product updates, practical guides, and clear analysis for teams putting business AI to work.

アーティフィシャル・インテリジェンス

アーティフィシャル・インテリジェンス 記事

79 記事

セマンティック検索とファインチューニング:ビジネスにおけるAIのトレーニングにはどちらが最適か?
  • アーティフィシャル・インテリジェンス

セマンティック検索とファインチューニング:ビジネスにおけるAIのトレーニングにはどちらが最適か?

技術主導の今日のビジネス環境では、人工知能を効果的に活用することが最も重要である。 GPT-3.5のような高度なモデルの台頭により、企業はしばしば重大な決断を迫られる:特定のデータセットでこれらのモデルを微調整するべきか、それともセマンティック検索に軸足を移すべきか。 このブログ記事は、両手法に光を当て、包括的な比較を提供することで、企業が十分な情報を得た上で決断できるようにすることを目的としている。 微調整を理解する ファインチューニングとは、まったく新しいスキルを習得するのではなく、あるスキルセットに磨きをかけることに似ている。 クラシックの訓練を受けたピアニストを想像してみてほしい。彼らはピアノの基礎的な理解を持っているが、ジャズを演奏するには多少の調整が必要かもしれない。 同様に、ファインチューニングによって、すでに豊富な知識を備えている事前訓練済みのAIモデルを、特定のタスクのために「微調整」することができる。 AIの領域では、微調整は転移学習の応用である。 転移学習は、最初に膨大なデータセットで訓練されたモデルを、より小さな特定のデータセットで再学習(または「微調整」)することを可能にする。 一番の利点は、ゼロから始める必要がないことだ。 このモデルは、事前の広範なトレーニングを活用し、新しいデータに合わせてパラメータを最小限に調整する。 しかし、よくある誤解は、微調整によってモデルに新しい知識が備わるというものだ。 実際には、ファインチューニングは新しいタスクにモデルを適応させるのであって、新しい情報を適応させるのではない。 ギターの弦を微調整して、演奏中に最適な音を出すようなものだと考えてほしい。 セマンティック検索を解明する セマンティック検索は、検索を一段上のレベルに引き上げる画期的なアプローチである。 伝統的な検索方法はキーワードに依存し、純粋に単語の一致に基づいて結果を返します。一方、セマンティック検索は、クエリの背後にある文脈や意図を理解することで、より深く掘り下げます。 セマンティック検索の核心はセマンティック埋め込みである。 これは、テキストデータの本質と意味を捉える数値表現である。 セマンティック検索を使って検索する場合、キーワードをマッチングさせるだけでなく、意味をマッチングさせることになる。 果物の『アップル』とハイテク企業の『アップル』を検索するかどうかの違いだ。 要するに、セマンティック検索は、より直感的で文脈を意識した情報検索の方法を提供する。 ニュアンスを理解し、正確で関連性の高い検索結果を提供する上で絶大な威力を発揮する。 ファインチューニング対セマンティック検索の対決 ファインチューニングとセマンティック検索を比較検討する場合、両者の目的が異なることを認識することが不可欠である: 基準 微調整 セマンティック検索 目的と用途 タスクの最適化を目指す。 例えば、ある企業が法律用語を理解するAIモデルを持っているが、それを環境法に特化させたい場合、微調整がそのルートになるだろう。 目的は意味に基づく情報検索である。 例えば、医学研究者が特定のタイプの希少疾患の症状に関連する記事を探している場合、セマンティック検索は深い理解の結果を提供するだろう。 コストと効率 時間的にも計算能力的にもリソースを大量に消費する可能性がある。 新しいデータが追加されるたびに再トレーニングが必要になり、コストがかさむかもしれない。 一度設定すれば、セマンティック検索システムは驚くほど効率的になる。 拡張性が高く、新しいデータを検索インデックスに組み込むのは一般的に簡単で、費用対効果も高い。 出力 特定のタスクにより適したモデルを作成する。 しかし、微調整はモデルの知識ベースを本質的に強化するものではない。 コンテンツの深い理解に基づき、関連性によってランク付けされた検索結果のリストを生成します。 最終的な感想 デューイ十進分類法を用いて図書館で適切な本を探し、ページをざっと読み、答えを導き出すためにノートをまとめるという古くから行われてきた習慣を思い起こすと、AIが情報を処理する方法のメタファーとして役立つ。 データが新たな石油となるこのデジタル時代においては、微調整とセマンティック検索のどちらを選ぶかが極めて重要になる。 それぞれの方法には長所があり、具体的なニーズによっては、どちらか一方が他方よりも適しているかもしれないし、あるいは両方をブレンドすることもできる。 プロセスが最適化され、効率が向上することを求める企業が増えているため、特定のビジネス・プロセスに合わせてトレーニングできるCodyのようなツールは貴重な資産となる。 そして、このAIの変革を体験したいと熱望する人々にとって、参入障壁は事実上存在しない。 Cody AIは、企業が初期投資なしでセマンティック検索の力を活用できるよう、無料で始めるチャンスを提供している。 日進月歩のAIと検索の世界において、コーディはセマンティック検索がビジネスに革命をもたらす可能性を証明している。

記事を読む
LLaMA 2:メタのオープンソースAIモデル
  • アーティフィシャル・インテリジェンス

LLaMA 2:メタのオープンソースAIモデル

街で最も新しいLLMは宣伝に値するか? 数日前、メタ社はマイクロソフト社とのコラボレーションにより、LLMの最新バージョン「ラマ2」をリリースした。 LLMの宣伝文句を追いかけている人なら、すでに耳にしたり、新機能について読んだりしているかもしれない。 物事を単純化するために、Llama 2がこれほど大評判になっている4つの理由と、いくつかの最高のLLMとの比較を列挙する。 研究・商用利用無料 Llama 2が人々の興味を引いた大きな理由のひとつは、メタ社が特定の条件がある一部の大企業を除き、ほぼすべての人に全モデルを無料にしたことだ。 この動きは、起業やジェネレーティブAIの世界への進出を考えている個人にエキサイティングな機会を提供する。 今こそAIの世界に飛び込む絶好の機会であり、特にこのレベルの言語モデルが自由に利用できるのだから。 オープンソースのモデルはすでに複数存在していたが、メタ社のような大企業が作ったものはなく、GPTの直接の競争相手にはなり得なかった。 「BLOOM(Scaoら、2022)、LLaMa-1(Touvronら、2023)、Falcon(Penedoら、2023)など、GPT-3(Brownら、2020)やChinchilla(Hoffmannら、2022)のようなクローズドな事前訓練された競合の性能に匹敵する事前訓練されたLLMが公開されています、2020)やChinchilla (Hoffmann et al., 2022)のようなクローズドな事前訓練された競合に匹敵する性能を持つが、これらのモデルのどれもがChatGPT、BARD、Claudeのようなクローズドな “製品 “LLMの代替には適していない。”- メタ研究論文 安全性 Meta research paperで発表された報告によると、Llama 2は、他のオープンソースモデルと比較して、有用性と安全性のベンチマークで優れたパフォーマンスを示している。 これらの点で、ChatGPT(7b、13b、70bモデル)を上回っている。 しかし、この研究論文は、ラマ2世に有利な偏ったデータがある可能性を認めており、結果を解釈する際にはそれを考慮する必要があることに注意する必要がある。 とはいえ、たとえラマ2がChatGPTベンチマークに近づいたとしても、賞賛に値する。 ラマ2の安全性に寄与する最も重要な要因のひとつは、そのデータプライバシーである。 いくつかのモデルとは異なり、Llama 2はOpenAIのような外部サーバーにデータを送信して応答を取得する必要はありません。 このユニークな属性は、ユーザーのデータを保護し、プライバシーを維持するのに役立つため、重要で機密性の高いユースケースで特に価値のあるモデルとなっている。 ユーザーは、自分のインフラ内にデータを収めたプライベートサーバー上でモデルを実行することができる。 オープンソース 現在使用されている最も一般的なLLMは、ブラックボックスとして動作しており、ユーザーはその機能を限定的にしか理解できない。 対照的に、オープンソースのモデルは透明なアプローチを提供し、ユーザーはその内部構造を理解することができる。 この透明性によって、スパムや偽情報の生成といった課題に直面する可能性があるにもかかわらず、このようなモデルを使用する際の自信と確信が生まれる。 さらに、これらのモデルのオープンソースとしての性質は、共同作業を促し、LLMの分野における継続的な改善と発展につながる。 その結果、オープンソースのモデルは、言語モデルの世界の進歩を推進する上で重要な役割を果たしている。 「そして、私たちはその方が安全だと信じています。今日のAIモデルへのアクセスをオープンにするということは、開発者や研究者の世代が、コミュニティとしてそれらをストレステストし、問題を迅速に特定し、解決できることを意味します。これらのツールが他の人々によってどのように使われているかを見ることで、我々のチームは彼らから学び、ツールを改善し、脆弱性を修正することができる。”- メタウェブサイト Llama 2はオープンライセンスだが、Meta社は学習させたデータをまだ公開していない。 Meta社は、Llama 2の研究論文の中で、「個人に関する個人情報が大量に含まれていることが知られている特定のサイトからデータを削除する努力をした」と述べているが、そのサイトが何であるかは記載していない。 パフォーマンス ラマ2のウエイトは4種類:7B、13B、34B、70B。 ウェイトは、モデルが学習したパラメータの数を表す。 一般的に、パラメータサイズが大きいほど、より正確で信頼性の高い応答が得られますが、計算リソースも大きくなります。 このモデルの人間らしい特性を向上させるため、ラマ2はインストラクション・チューニングと、GPTでも使われているRLHF(人間フィードバックによる強化学習)手法を使って微調整を行っている。 70Bのパラメータ・サイズはかなりのものだが、それでも175Bのパラメータ・サイズを持つGPT-3.5には及ばない。 その結果、Llama 2の性能はGPT-3.5には及ばないかもしれないが、ベンチマークテストでは、パラメータサイズが小さくても拮抗していることが示されている。 この違いにもかかわらず、Llama 2は現在入手可能な既存のオープンソースモデルをすべて凌駕している。 「RLHFは、微調整された言語モデルに適用されるモデル学習手順である。… Read more »

記事を読む
Falcon LLM is a model suite with variations like Falcon 180B, 40B, 7.5B, and 1.3B, designed to address complex challenges for commercial AI.
  • AIツール
  • アーティフィシャル・インテリジェンス
  • +1

ファルコンLLM:オープンソースイノベーションでAIを再定義する

人工知能(AI)は急速に進化し、企業にとって戦略的なテコとなり、イノベーションの加速装置となっている。 この革命の中心にいるのが、AI業界の重要なプレーヤーであるファルコンLLMだ。 ファルコンLLM(ラージ・ランゲージ・モデル)は、人間の言語を解釈・生成する最先端の技術である。 その最先端の機能により、文脈を理解し、補完、翻訳、要約を生成し、指定されたスタイルで書くこともできる。 ファルコンLLMとは? ファルコンLLMは、最も先進的なオープンソースの大規模言語モデル(LLM)の1つとして登場し、AIの展望における極めて重要な変化を象徴しています。 ファルコン180B、40B、7.5B、1.3Bなどのバリエーションを含むこのモデル群は、複雑な課題に対処し、さまざまなアプリケーションを前進させるために設計されている。 ファルコンLLM、特に7Bと40Bモデルのオープンソース化は、最先端のAI技術へのアクセスを民主化し、個人や組織がそれぞれのシステム上でこれらのモデルを実行することを可能にする。 ファルコンLLMは何に使われていますか? ファルコンLLMのアーキテクチャは推論のために最適化されており、他の主要モデルに対して際立ったパフォーマンスを発揮することに貢献している。 REFINEDWEBデータセットは、さまざまなウェブソースデータを網羅しており、推論や知識テストのようなタスクで卓越した能力を発揮する。 何百ものGPUからなる高度なインフラを使用し、1兆のトークンでモデルをトレーニングしたことは、AI開発における重要な成果である。 企業には多くのメリットがある: 協力と知識の共有を奨励する 柔軟性とカスタマイズ・オプションを提供する イノベーションと急速な発展を促進する これらのモデルのオープンソースの性質は、一般にアクセス可能であることを意味し、誰でも必要に応じてソースコードを調査、修正、配布することができる。 この透明性がユーザー間の信頼を促進し、問題解決と技術進歩を促進する。 エンタープライズAIモデルとは、特にエンタープライズ・アプリケーション向けに設計されたAI技術を指す。 これらのモデルは、タスクの自動化、より多くの情報に基づいた意思決定、オペレーションの最適化、顧客体験の向上など、さまざまな利点でビジネスを支援する。 このようなモデルの採用は、競争上の優位性をもたらし、ビジネスの成長を促進するなど、組織にとって変革をもたらす可能性がある。 本稿では、ファルコンLLM技術の仕組み、オープンソースであること、様々な産業での使用例、クローズドソースのAIモデルとの比較、そして商業的な有用性と効率的なリソース利用について掘り下げていく。 ファルコンLLMのオープンソーステクノロジーを理解する ファルコンLLMはAI技術の先陣を切っている。 これは強力な大規模言語モデル(LLM)であり、人工知能業界に革命を起こすという魅力的な約束がある。 この大胆な約束は、企業が潜在能力を最大限に発揮できるように設計された独自の機能によって裏付けられている。 ファルコンLLMの何が特別なのかを理解するためには、LLMの概念を理解しなければならない。 これは、人間の言語を理解し、生成するために特別に設計されたAIモデルの一種である。 膨大なテキストデータを処理することで、法学修士はエッセイを書いたり、問い合わせに答えたり、言語を翻訳したり、詩を作ったりすることさえできる。 このような機能により、企業は顧客サービスからコンテンツ生成まで、幅広い用途にこれらのモデルを展開することができる。 しかし、ファルコンLLMの真の実力は、その革新的な共同作業にある。NVIDIAと マイクロソフトは、その開発に貢献している注目すべき協力者の一人である。 エヌビディアの高度なハードウェアアクセラレータとマイクロソフトの広範なクラウドインフラストラクチャは、ファルコンLLMの洗練されたAIオペレーションを支える強力な柱として機能する。 例えば、エヌビディアの最先端のグラフィック・プロセッシング・ユニット(GPU)は、こうした大規模な言語モデルの学習に必要な計算能力を向上させる。 これをマイクロソフトのAzureクラウドプラットフォームと組み合わせることで、さまざまな企業アプリケーションにファルコンLLMをシームレスに展開・運用できるスケーラブルなソリューションを提供します。 この共生的コラボレーションは、ファルコンLLMの優れたパフォーマンスを保証すると同時に、エンタープライズアプリケーションにおける効率性と拡張性を維持します。 インフラストラクチャーの制限やリソースの制約を気にすることなく、企業がAIの力を活用する道を開く。 このテクノロジーを取り入れることで、顧客体験の向上から日常業務の自動化まで、企業にとってかつてないチャンスへの扉が開かれる。 次のセクションでは、ファルコンLLMのAIランドスケープにおけるポジションを定義する上で、オープンソースがいかに重要な役割を果たしているかについて掘り下げていく。 ファルコンLLMにおけるオープンソースの役割 オープンソースのアプローチは、グローバルなAIコミュニティがモデルに貢献し、改良を加えることができる共同作業環境を促進する。 この集団的努力は、ファルコンLLMがAI技術の最前線にとどまることを確実にし、より迅速な進歩と多様な応用につながる。 オープンソースは、ファルコンLLMテクノロジーの単なる構成要素ではなく、重要な推進力です。オープンソースは、透明性、柔軟性、共同開発を含む様々な利点をテーブルにもたらし、AIモデルの進歩と強化に大きく貢献します。 ファルコンLLMのオープンソースアプローチは、これらの利点を取り入れています。 知識の共有と集団的な改善を促す環境を培っている。 ファルコンLLMは、そのAIモデルのコードベースへのアクセスを提供することで、世界中の開発者がそのアルゴリズムを研究し、修正し、強化することを可能にしている。 これにより、継続的な革新と改善のサイクルが促進され、これらのモデルを使用する企業に直接的な利益をもたらす。 ファルコンLLMのオープンソースの道のりを形作る上で、先端技術研究評議会と技術革新研究所は重要な役割を果たした。 彼らの関与は、技術革新を促進するだけでなく、AIの限界を押し広げることに専心する研究者や開発者のコミュニティを育成してきた。 この相乗効果により、企業の多様なニーズに対応できる強固で強力なAIモデルが誕生した。 「コラボレーションはオープンソースの基盤です。先進技術研究会議や技術革新研究所のような組織を巻き込むことで、私たちはAIの進歩に向けて世界中の頭脳が協力し合うプラットフォームを作り出しているのです” Falcon LLMのようなオープンソースモデルは、AI技術の民主化において重要な役割を果たす。 最先端のモデルへの無料アクセスを提供することで、ファルコンLLMは、個人の研究者から大企業に至るまで、さまざまなユーザーが、独占的なモデルに通常伴う高いコストをかけずにAIを探求し、革新することを可能にします。 オープンソースのAIモデルの利点は大きいが、課題がないわけではない:… Read more »

記事を読む
クロードの100Kコンテクストで、ビジネスのための深い分析と洞察がどのように可能になるか?
  • アーティフィシャル・インテリジェンス

クロードの100Kコンテクストで、ビジネスのための深い分析と洞察がどのように可能になるか?

最近、Anthropicの会話AIアシスタントであるClaudeに10万トークンのコンテキストウィンドウが導入されたことは、自然言語処理にとって記念碑的な飛躍を意味する。 企業にとって、この急激な拡大は、洞察力を引き出し、分析を行い、意思決定を強化するための、ゲームを変えるような新しい機能を解き放つ。 この詳細なブログ記事では、クロードのコンテキスト能力の向上がもたらす変革の意味について掘り下げる。 実際のビジネスユースケースや、なぜコンテキストの増加が重要なのか、そしてクロードの100Kの超強力な理解力を企業がどのように活用できるのかを探ります。 始めよう。 10万トークンの力 まず、10万トークンのコンテクストとは何を意味するのか? ひとつの単語には平均して4~5個のトークンが含まれる。 つまり、10万トークンは約2万~2万5千語、75~100ページのテキストに相当する。 これは、クロードが制約を受けていた以前の9,000トークンの制限を凌ぐものだ。 100Kのコンテクストにより、クロードは財務報告書、研究論文、法的契約書、技術マニュアルなどの文書を徹底的に消化することができる。 平均的な人が1時間に読める単語数は5,000~6,000語である。 10万トークンのテキストを完全に処理するには5時間以上かかる。 情報を深く理解し、想起し、分析するためには、さらに多くの時間が必要だろう。 しかし、クロードはこの途方もない長さの文書をわずか数秒で取り込み、評価することができる。 クロードの可能性を最大限に引き出すビジネス・インサイト 企業にとって、クロードのコンテキスト・サイズの向上は、膨大な文書から重要な洞察を引き出す可能性を飛躍的に高める: 長い財務報告書、調査報告書、技術仕様書、その他密度の濃い資料の中から重要な詳細を特定する。 クロードは、重要なトレンド、リスク、脚注、開示情報を表示するために、10万トークンのテキストをレビューし、相互参照することができます。 マニュアル、契約書、報告書など、長い資料の異なるセクション間のつながりを描く。 クロードは100ページの文書に散らばった知識を吸収し、その関係を統合することができる。 大きなテキストで提示された議論、提案、見解の長所、短所、省略、矛盾を評価する。 クロードは本の長さのある原稿を批評し、推論を比較することができる。 大規模な文書やデータセットの多くの部分から洞察を統合する必要がある複雑な質問に答える。 10万トークンは、クロードがこうしたコネクションを作るのに十分なコンテキストを提供する。 ニッチな研究、データ、文献の山を処理することで、専門領域の高度な理解を深める。 クロードは10万トークンのニッチな業界情報を理解することでエキスパートになる。 膨大なドキュメントの要点を、読者のニーズに合わせてカスタマイズして要約。 クロードは、500ページを、ユーザーが要求するセクションだけをカバーする10ページの要約に減らすことができる。 技術マニュアル、ナレッジベース、その他のリポジトリから重要な文章を抽出し、特定のクエリに対応する。 クロードは100Kトークンのコンテンツをインデックス化し、必要な関連情報を効率的に探し出します。 マッシブ・コンテキストがビジネスにもたらすもの クロードの潜在的なコンテキスト・ウィンドウを10万トークンに拡大することは、企業ユーザーにとって非常に大きな意味を持つ。 コンテキストの幅を広げることが非常に重要である主な理由をいくつか挙げてみよう: 従業員の時間と労力を節約 – クロードは、スタッフが5時間以上かかるものを1分で読み、処理し、分析することができます。 これは非常に大きな時間の節約になる。 正確さと精度の向上 – より多くの文脈を理解することで、クロードは、背景があまり理解できていない弱い理解力に比べ、より良い、よりニュアンスのある答えを出すことができる。 微妙なつながりを作る能力 – クロードは、人間が見逃してしまうようなニュアンス、矛盾、省略、100ページにわたるテキストのパターンを拾い上げることができる。 カスタマイズされた業界専門知識の開発 – 企業は10万トークンの独自データを使用して、自社のビジネスに合わせたニッチなドメイン知識をクロードに装備させることができる。 長期的な会話の一貫性 – より多くの文脈を持つクロードとの対話は、一貫性を失うことなく、より長く生産的に続けることができる。 複雑な推論が可能 – クロードは、10万トークンのテキストにまたがる複雑な議論ロジックをたどり、連鎖的な意味を推論することができる。 データ駆動型のレコメンデーションの向上 –… Read more »

記事を読む
お客様のデータは当社で安全に保護されます
  • AIナレッジベース
  • アーティフィシャル・インテリジェンス

お客様のデータは当社で安全に保護されます

データセキュリティとプライバシーへの取り組み ChatGPTは人工知能の代名詞となり、これまでAIになじみのなかった人たちでさえ、AIについての知識を得るようになった。 その人気は急上昇し、企業や個人はChatGPTに似ているが自社のデータに合わせたAIボットを求めるようになった。 Cody AIでは、このプロセスを簡素化し、合理化することで、AIの複雑な技術的問題を掘り下げる必要をなくすとともに、最新のイノベーションに対応することを目指しています。 カスタムユースケースでAIを使用する個人や企業の間で大きな懸念となっているのが、データの完全性とセキュリティだ。 GPTのような言語モデルを構築するには、膨大なトレーニングデータセットを使用する必要がある。 Cody AIでは、このような懸念を理解し尊重し、お客様のデータとプライバシーの保護を優先しています。 Codyがどのようにプロセス全体を通してデータのセキュリティを確保するのかを理解するために、その道のりを3つのセクションに分けてみよう:ドキュメント、エンベッディング、モデルです。 書類 Codyは安全でプライベートなAmazon Simple Storage Service (S3)を利用し、処理前の初期段階でドキュメントを保存します。 S3は全てのバケットへの全てのオブジェクトのアップロードの暗号化を保証し、PCI-DSS、HIPAA/HITECH、FedRAMP、EUデータ保護指令、FISMAのような様々なプログラムへのコンプライアンスを維持する。 これにより、お客様のデータは確実に保護され、規制要件に準拠します。 Codyにアップロードされたドキュメントは、SSE-S3(Server-Side Encryption)プロトコルに従い、あなたとあなたのチームメンバーだけがアクセスでき、データの機密性とプライバシーが保証されます。 埋め込み エンベッディングは基本的に、データをベクトル(数値のリスト)の形で表現したものです。 コーディに提供されるデータは構造化されていないため、埋め込みデータに変換することで、より高速な検索と意味検索が可能になる。 Codyがどのように文書から回答を生成するかについては、こちらの記事をご覧ください。 これらのベクトルや埋め込みを保存するために、CodyはPineconeという大企業から信頼されているセキュアなベクトルデータベースに依存している。 Pineconeは、以下のような強固なセキュリティ機能を提供している: SOC2 Type II 認証 GDPR対応 脆弱性をチェックするための定期的な侵入テスト。 完全に管理されたセキュアなAWSインフラ上でKubernetesコンテナを分離し、データを保存。 モデル Cody AIはOpenAIのGPTモデル(GPT-3.5、GPT-3.5 16K、GPT-4を含む)を活用して応答を生成します。 リソースの制限のため、これらのモデルはコーディのネイティブサーバーではホスティングされていません。 その代わりに、OpenAIが提供するAPI(ドキュメントやクエリのエンベッディングの作成にも使用される)を利用する。 回答を生成する際には、すべての文書を送信するのではなく、質問されたことに関連するデータの特定の部分のみをリクエストで送信する。 このアプローチは、効率的な処理、データの完全性を保証し、不必要なデータ転送を最小限に抑える。 APIによって提供される追加のセキュリティメカニズムは、あなたのデータが既存または新しい言語モデルの学習に使用されないことです。 これにより、お客様のデータはお客様のボットに限定され、モデルのトレーニング目的には使用されません。 2023年3月1日より、データの使用および保持に関するポリシーを2点変更いたします: 1.OpenAIは、お客様が明示的にこの目的のためにお客様のデータを弊社と共有することを決定しない限り、弊社のモデルを訓練または改善するために、弊社のAPIを介してお客様から提出されたデータを使用しません。 データ共有のオプトインが可能です。 2.APIを通じて送信されたデータは、不正使用および誤用監視の目的で最大30日間保持され、その後削除されます(法律で義務付けられている場合を除く)。 ソースオープンAI このコミットメントにより、機密性のレイヤーが追加され、お客様のデータのプライバシーとセキュリティが保証されます。 詳しくはこちらの記事をご覧いただきたい。 結論 これら3つの要素を総合的に考慮すると、Cody AIはデータ・セキュリティとコンプライアンスに対してきちんと構築されたアプローチを示し、お客様のデータの99%のセキュリティを保証します。 データ・プライバシーが最も重要視される時代において、私たちはお客様のデータの完全なセキュリティを確保するために、それ以上の努力を惜しみません。 Cody… Read more »

記事を読む
エクセルデータでGPTを無料でトレーニングするには? (ベータ)
  • AIナレッジベース
  • アーティフィシャル・インテリジェンス
  • +1

エクセルデータでGPTを無料でトレーニングするには? (ベータ)

CodyのナレッジベースとトレーニングChatGPTにExcelデータを追加するためのガイドを無料で提供しています。 御社のExcelデータでコーディーのトレーニングを始める前に、ボットから最高の回答を得るためにいくつかのコンセプトを明確にする必要があります。 GPT(Generative Pre-Trained Transformers)とは、文やフレーズを完成させるために、次の単語を予測するために広範なデータセットで訓練された言語モデルである。 これらは特に、構造化されていない会話や文字データの大規模なサンプルからなる自然言語データセットで学習される。 線形回帰のような統計モデルとは異なり、GPTは論理的な学習データを使って数値を予測することには長けていない。 例えば、2+2=5と主張するデータセットでGPTを訓練すると、GPTは論理的矛盾を理解しようとせずに、2+2=5と答えるだろう(これはあくまで例であり、OpenAIはこのようなクエリにも正確な回答を返す)。 これはLLMのもう一つの限界である幻覚と相まって、数学的計算には不向きな環境を作り出している。 GPTの限界を理解したところで、GPTをExcelデータでトレーニングするプロセスを無料でご案内しましょう。 CodyのナレッジベースにExcelやCSVデータを追加する方法を開発しました。 前述したように、GPTは自然言語を理解することに長けているので、Excelデータを言語モデルによって簡単に読み取れる形式に変換します。 ステップ1:エクセルデータの変換 ボットを訓練したいCSVまたはExcelデータを取得し、弊社が作成したユーティリティを使用してテキストファイルに変換します。 このユーティリティは、対応するヘッダーでデータに注釈を付けることで、エクセルデータをテキストファイルに変換します。 セル項目にヘッダーのアノテーションを付けることで、前処理の段階で文書のセグメンテーションによってヘッダーがスキップされる可能性が高くなるため、言語モデルが文脈をより理解しやすくなる。 例えば。 エクセルのデータ: 名称 年齢 ジョン 16 マリー 18 テキストデータ: {The Name is ‘John’. The Age is ‘16’.}, {The Name is ‘Marie’. The Age is ‘18’.} 生成されるテキストファイルは、JSONに似たフォーマットに従っているが、より人間に近い感覚を提供するために、より文学的なスタイルになっている。 このソリューションは現在実験段階であり、Codyアプリにはまだ統合されていませんが、GPTの3モデルすべてでうまく機能します。 ユーティリティ・インターフェース: サンプルCSVデータ: ボットから最高の品質の回答を得るには、変換前にデータをクリーニングすることをお勧めします。 CSVまたはExcelデータをユーティリティにアップロードした後、GPT互換テキストファイルを生成する前にデータをプレビューすることができます。 パートごとの行数:大きなデータセットの場合、データセットを複数のパートに分割することが望ましい。 この分割により、セマンティック検索が改善され、回答の質が向上する。 セル参照を含める:テキストファイルにExcelのセル参照を含める場合は、このオプションを選択できます。 ボットは、エクセルで実行可能なアクションのステップバイステップのガイドを作成する際に、これらのセル参照を参照することができます。 例えば、中央値を求める数式を生成することができる。 圧縮されたzipフォルダーが生成され、その中にはエクセルデータのすべての部分が.txt形式で含まれています。 ステップ2:Codyナレッジベースにデータを追加する 変換されたデータをCody… Read more »

記事を読む

最初のアシスタントは数分の距離にあります

ビジネス知識を活用しましょう。

無料の Cody アカウントから始めてください。コンテンツを追加し、アシスタントを構築し、最初の役立つ回答を今すぐ共有してください。