EC2スポットインスタンス×vLLMでGPUコストを大幅削減する
はじめに # 前回の記事(自前vLLMをOpen WebUI経由でVS Code(Cline)に接続!トークンフリーで開発する)では、オープンソースのWeb UI・APIゲートウェイ「Open WebUI」を採用し、AWS上で動かす自前vLLMサーバーをVS Code拡張機能「Cline」のバックエンドとして直結させました。 前回の検証では「1台のGPUサーバー(g6.xlarge)をチーム3〜5人でシェアする」運用モデルを検討し、実用的なコストパフォーマンスが得られることを確認しました...
記事を読む自前vLLMをOpen WebUI経由でVS Code(Cline)に接続!トークンフリーで開発する
はじめに # 前回の記事(AWS×UserDataでvLLMを自動起動!停止時コストほぼゼロのローカルLLM環境)では、AWSのUserDataとS3を活用してvLLMを全自動起動し、使い終わったらTerminate(終了)することで停止中のEBS維持コストをほぼゼロにするエフェメラルなLLM推論環境を作りました...
記事を読むAWS×UserDataでvLLMを自動起動!停止時コストほぼゼロのローカルLLM環境
はじめに # オープンソースLLMが急速に進化する中、「機密情報や社内コードも気にせず扱える、自分専用のローカルLLM環境が欲しいな」と思い立ちました。 ただ、いざ本格的に手元(オンプレミス)で動かそうとすると、大容量VRAMを積んだGPU搭載PCが必要になり、調達するのに数十万円もの初期費用(イニシャルコスト) がかかってしまいます。「まずは効果があるか試してみたい」という検証段階で、いきなり高額なハードウェア購入稟議を通すのはハードルが高いものです...
記事を読む
