#author("2026-08-26T15:20:24+00:00","default:iseki","iseki") #author("2026-08-26T15:20:50+00:00","default:iseki","iseki") * Local LLM ** vllm *** Python 仮想環境 python3.12 -m venv /opt/venvs/guest01 chown -R guest01:llm guest01 *** VLLM *** Install source /opt/venvs/guest/bin/activate python -m pip install -U pip uv *** RTX 6000 **** GPU + NVIDIA のドライバーをインストール -- dkms status でカーネルモジュールの構築・登録状態を確認 -- nvidia-smi でドライバーの動作とGPUの認識を確認 + カーネルの versionlock 設定 -- versionlock を設定 + CUDA Toolkitのインストールと動作確認 -- nvcc --version で CUDAコンパイラのバージョンを確認 -- deviceQuery で CUDAプログラムの実行を確認 **** 環境 + LLM実行用ユーザーとグループの作成 + LLM用ディレクトリの構成 + Python 3.12 の追加 **** LLM実行環境の構築と確認 + Transformers実験用の Python仮想環境の構築 + PyTorchの導入と GPU確認 + Transformersによる LLM推論 **** モデルの選定 - Qwen3-32B (BF16) と Qwen3-32B-FP8, Qwen3-Swallow-32B-RL-v0.2 を比較 -- 推論速度,GPUメモリ使用量,出力品質を確認 -- 通常対話用:Qwen3-32B-FP8 -- 日本語研究対話用:Qwen3-Swallow-32B-RL-v0.2 ****