LoRA/QLoRA/DoRA ファインチューン(ローラキューローラ)
LLM低コストファインチューン。LoRA(Low-Rank Adaptation・2021年・rank 8-64)・QLoRA(4-bit NF4 + LoRA・consumer GPU 24GB でLlama 65B学習)・DoRA(Weight-Decomposed・2024年)・VeRA(Vector-based・Minimal param)・GaLore(Gradient Low-rank・full fine-tune)・Galore-bit・Unsloth(2-5x高速)・Axolotl YAML config・Hugging Face PEFT・TRL library対応、2026年コンシューマGPU学習定着。
概要
LoRA(Low‑Rank Adaptation)は 2021 年に登場し、重み行列を低ランクで分解してパラメータ数を大幅に削減する手法です。
QLoRA は 4‑bit NF4 量子化と LoRA を組み合わせ、24GB GDDR7 を搭載した consumer GPU で Llama 65B を学習できるようにしました。
DoRA(Weight‑Decomposed)は 2024 年に発表され、重みを行列分解とスケーリングで再構築し、さらにパラメータを削減します。
VeRA(Vector‑based)は最小パラメータで微調整を行い、GaLore は Gradient‑Low‑Rank を採用してフルファインチューンを高速化します。
Unsloth は 2‑5 倍の高速化を実現し、Axolotl YAML config で設定を簡易化。Hugging Face PEFT と TRL ライブラリに対応し、2026 年にはコンシューマ GPU での学習が定着しています。
主な特徴・仕組み
- LoRA:重み行列を rank 8‑64 で分解し、追加パラメータを数百 MB に抑える。
- QLoRA:4‑bit NF4 量子化でメモリ使用量を 4 倍削減し、LoRA で微調整。
- DoRA:重みを行列分解+スケーリングで再構築し、パラメータ数を 1/10 まで削減。
- VeRA:ベクトルベースで最小パラメータで学習。
- GaLore:Gradient‑Low‑Rank を利用し、フルファインチューンを 3 倍速化。
- Unsloth:学習速度を 2‑5 倍に向上。
- Axolotl YAML:設定を YAML で管理し、再現性を高める。
- PEFT/TRL:Hugging Face の PEFT と TRL ライブラリで統合。
スペック/製品比較表
| 手法 | 量子化 | rank | 追加パラメータ | 学習速度 | 主なGPU | 備考 |
|---|---|---|---|---|---|---|
| LoRA | なし | 8‑64 | 数百 MB | 1.5× | RTX 4090 | 低コスト |
| QLoRA | 4‑bit NF4 | 8‑64 | 数百 MB | 2.0× | RTX 5090 | 65B 学習可 |
| DoRA | なし | 8‑64 | 50 MB | 1.8× | RTX 3090 | 2024 年版 |
| VeRA | なし | 8‑64 | 30 MB | 1.6× | RTX 3090 | 最小パラメータ |
| GaLore | なし | 8‑64 | 200 MB | 3.0× | RTX 4090 | フルファインチューン |
具体例・対応製品
- RTX 5090:24GB GDDR7、PCIe 5.0 x16、650W PSU、120mm ファン、2025 年モデル。
- Ryzen 9 9950X3D:3.5GHz、32GB DDR5‑4800、2.5GHz クロック、2025 年リリース。
- Core Ultra 9 285K:5.7GHz、8GB HBM2、1TB NVMe、2026 年予定。
- RTX 4090:24GB GDDR7、PCIe 5.0 x16、650W PSU、2025 年モデル。
- RTX 3090:24GB GDDR6X、PCIe 4.0 x16、350W PSU、2024 年リリース。
自作PCでの選び方・注意点
- GPU は 24GB 以上の VRAM を持つものを選ぶ。
- PCIe 5.0 x16 対応で帯域を確保。
- 650W 以上の PSU を用意。
- 120mm ファンで冷却性能を確保。
- DDR5‑4800 以上のメモリを搭載。
- NVMe 1TB 以上のストレージを用意。
- 4‑bit NF4 量子化をサポートするドライバを確認。
- LoRA/QLoRA 用のライブラリを最新に保つ。
- Unsloth で学習速度を確認。
- AXOLOTL YAML 設定をバックアップ。
関連用語との違い
- LoRA は低ランク分解のみ。
- QLoRA は LoRA + 4‑bit NF4 量子化。
- DoRA は重み分解+スケーリング。
- VeRA はベクトルベースで最小パラメータ。
- GaLore は Gradient‑Low‑Rank を採用。
- Unsloth は学習速度を向上。
- Axolotl YAML は設定管理。
よくある質問
Q1. QLoRA は 24GB GDDR7 のみで学習可能ですか?
A1. はい。24GB GDDR7 を搭載した RTX 5090 で Llama 65B を学習できます。
Q2. DoRA はどのようにパラメータを削減しますか?
A2. 重みを行列分解し、スケーリング係数で再構築することで、追加パラメータを 50 MB まで削減します。
Q3. Unsloth を使うと学習速度は何倍になりますか?
A3. Unsloth は 2‑5 倍の高速化を実現し、フルファインチューンの時間を大幅に短縮します。
まとめ
LoRA、QLoRA、DoRA、VeRA、GaLore、Unsloth などの低コストファインチューン手法は、2025 年以降の次世代コンシューマ GPU での実用化が進んでいます。
RTX 5090 や Ryzen 9 9950X3D などの最新ハードウェアと組み合わせることで、24GB GDDR7 以上の VRAM を持つ GPU で 65B 以上の大規模モデルを学習可能です。
自作 PC での構築時は GPU、メモリ、ストレージ、電源、冷却をバランス良く選定し、PEFT/TRL ライブラリと AXOLOTL YAML 設定を活用すれば、効率的に学習を進められます。