EC2スポットインスタンス×vLLMでGPUコストを大幅削減する
はじめに # 前回の記事(自前vLLMをOpen WebUI経由でVS Code(Cline)に接続!トークンフリーで開発する)では、オープンソースのWeb UI・APIゲートウェイ「Open WebUI」を採用し、AWS上で動かす自前vLLMサーバーをVS Code拡張機能「Cline」のバックエンドとして直結させました。 前回の検証では「1台のGPUサーバー(g6.xlarge)をチーム3〜5人でシェアする」運用モデルを検討し、実用的なコストパフォーマンスが得られることを確認しました...
記事を読む自前vLLMをOpen WebUI経由でVS Code(Cline)に接続!トークンフリーで開発する
はじめに # 前回の記事(AWS×UserDataでvLLMを自動起動!停止時コストほぼゼロのローカルLLM環境)では、AWSのUserDataとS3を活用してvLLMを全自動起動し、使い終わったらTerminate(終了)することで停止中のEBS維持コストをほぼゼロにするエフェメラルなLLM推論環境を作りました...
記事を読むAWS×UserDataでvLLMを自動起動!停止時コストほぼゼロのローカルLLM環境
はじめに # オープンソースLLMが急速に進化する中、「機密情報や社内コードも気にせず扱える、自分専用のローカルLLM環境が欲しいな」と思い立ちました。 ただ、いざ本格的に手元(オンプレミス)で動かそうとすると、大容量VRAMを積んだGPU搭載PCが必要になり、調達するのに数十万円もの初期費用(イニシャルコスト) がかかってしまいます。「まずは効果があるか試してみたい」という検証段階で、いきなり高額なハードウェア購入稟議を通すのはハードルが高いものです...
記事を読むAWSで自分だけのLLM環境を!EC2 GPUインスタンスとOllamaでAIを動かす実践ガイド
はじめに # 「クラウドで手軽にGPUを借りて、最新のLLM(大規模言語モデル)を動かしてみたい!」 そんな思いつきから、AWSのEC2 GPUインスタンス+Ollamaを使って、オープンソースのLLM実行環境を構築する検証を行いました。本記事では、その際の手順や得られた知見を、備忘録も兼ねてご紹介します。 ✔️ STEP 1: EC2インスタンスタイプの選定 # まずは、LLMを快適に動かすための「心臓部」となるEC2インスタンスを選びます...
記事を読む
