E

ExLlamaV3

E
ExLlamaV3 AI v1.5.0

1.5.0 について

NemotronHForCausalLMを修正 (Nemotron-3-Superをサポート) より速い量子化 CPUのオフロードのための実験的なゼロコピーのピンドアリーナモード (Linuxのみ) より速いMoEプリフィールと解読 (下記を参照) MoEモデルのための推測的な解読の改善 いくつかのアーキテクチャでより速い密度のモデルプリフィール いくつかの非決定論のソースを削除 バグ修正とクリーンアップ テストケース 4kプリフィール、t/s解読、t/s,S=1 Qwen3.8-Flas...

E
ExLlamaV3 AI v1.4.9

1.4.9 農業について

DeepseekV4ForCausalLMビジョンタワーを追加 (DeepseekV4-Flash-Vision-Expをサポート) Lfm2ForCausalLMを追加 (LFM2.5密度の多様体) Spark2_5ForCausalLMを追加 (Spark-X2.5) Glm4MoeLiteForCausalLMを追加 (GLM4.7-Flash) より正確なオートスプリット会計 速いCPUオフロード、より良いインテルサポート (AVX512BW層) ビジョンタワーオフロード後にVRAM漏れを修正 大型モデルをオフロードする際に潜在的な労働者のタイムアウトを修正する。..

E
ExLlamaV3 AI v1.4.8

1.4.8 農業について

pyproject.toml を追加 DSv4-Flash,Qwen3.8-Flash-Next,および GLM5.3-Flash のキャッシュ量子化 VRAM 割り当てを最適化し、デフォルトで拡張可能なセグメントに切り替える FA2 コード経路を完全に削除 その他の最適化とバグ修正 完全変更日記: v1.4.7...v1.4.8

E
ExLlamaV3 AI v1.4.7

1.4.7 開発について

すべてのレベルの CPU MoE 性能改善 DRY サンプラーを追加 繰り返されるスロット漏れを修正 6,7 および 8 ビット・トレリーズの量子化が速く 他の多くのバグ修正、最適化およびQoLの改善 フル・チャングログ: v1.4.6...v1.4.7

E
ExLlamaV3 AI v1.4.6

1.4.6 農業について

v1.4.6 からいくつかのリグレーションを修正 Windows のための実験 n-gram ストリーミングを追加します 完全な変更日記: v1.4.5...v1.4.6

E
ExLlamaV3 AI v1.4.5

1.4.5 農業について

サポート Glm5NextForConditionalGeneration (GLM5.3-Flash) サポート Qwen4ExpForConditionalGeneration (Qwen3.8-Flash-Next) 改善された MoE MTP 性能 MoE レイヤのスラブアロケーション 間違ったアライナインされた専門家テンソール形状のために無駄な VRAM を避ける トリトン条件レース (オートチューナー: 'NoneType' オブジェクトはマッピングエラーではありません) を回避する作業 ユニグラムトークナイザーの修正 その他のバグ修正およびQoLの改善 完全な変更日記:...

E
ExLlamaV3 AI v1.4.4

1.4.4 開発について

スプリット MoE CPU-オフロードモードにおける正確性バグの修正 専門家並行モードにおけるより良い MTP サポート ビジョンタワーの量子化への検証とデフォルト ビジョンモデルのオフロードをサポート (システムメモリからのストリーム、パフォーマンスの罰は小さい) 全変更ログ: v1.4.3...v1.4.4

E
ExLlamaV3 AI v1.4.3

1.4.3 について

サポート GlmMoeDsaForCauslLM (GLM 5.2,まだ少しWIPである可能性が高い) ダイナミックな配置 (エキスパートキャッシュを置き換える) を有する部分的なCPU層エキスパートオフロードオプション 自動校正された信頼性値でダイナミックなドラフトサイズの改善 新しい (実験的な) 量子最適化パイプライン 発電機のミッドストリームテキストインジェクションをサポートする (推理トークン予算を有効にする) より正確な自動分割割り当て 削減。..

E
ExLlamaV3 AI v1.4.1

1.4.1 開発について

Mistral-4 を追加 (Mistral3ForConditionalGeneration の下に) ロジットバイアスをサポートする Formatron の代わりに LLGuidance を採用する (依然としてオプション依存としてサポートされる) banned_strings の隣にフィルター/文法を許可する 完全な変更ログ: v1.4.0...v1.4.1

E
ExLlamaV3 AI v1.4.0

1.4.0 地域社会

サポート DeepseekV4ForCausalLM AVX512 CPU のオフロード性能が向上した プレフィール速度が速い (すべてのモデル) バグ修正 QoL 機能 完全変更日記: v1.3.0...v1.4.0

E
ExLlamaV3 AI v1.3.0

1.3.0 開発

DeepseekV3の初期サポート (JoyAI-LLM-FlashとMoonlight-16B-A3Bに対して検証、ルーティンググループはまだない) 2階層CPU K/Vキャッシュ、よりインテリジェントなページとチェックポイント退出ポリシー Freq/rep 修正。XTCサンプラーとトークン禁止の長期文脈の遅延を引き起こす罰 セキュリティーセンサの読み込みの潜在脆弱性を軽減 他のバグ修正、最適化、QoLの改善 Ful...

E
ExLlamaV3 AI v1.2.1

1.2.1 開発

より速い量子化 Windows: JITコンパイルエラーと壊れた CPUオフロードパフォーマンスの修正 多トークン文字の終わりと始まりの両方のトークンの解読を壊すトークナイザー問題の修正 (韓国語スペシャル) 完全な変更日記: v1.2.0...v1.2.1

E
ExLlamaV3 AI v1.2.0

1.2.0 農業について

LagunaForCausalLM (およびDFlashLagunaForCausalLM) のサポート 専門家層の実験的なCPUオフロードサポート 実験的なダイナミック・ドラフトウィンドウ機能 改善されたセーフェテンサーの読み込み (より速く) より多くのグラフ経路 性能チューニング compare_q.pyを削除し、qbench.pyで置き換えられた 様々なバグ修正 完全変更日記: v1.1.0...v1.2.0

E
ExLlamaV3 AI v1.1.0

1.1.0 について

HYV3ForCausalLMをサポートする TPモードのCPUオーバーヘッド削減とネイティブバックエンドのプレフィールパフォーマンスの改善 トーチ。マルチノミアルの暗黙の断片処理動作に一致するようにトップ-P=1サンプリングを調整する 繰り返しモデルでサポートされている禁止文字列 バグ修正とQoLの改善 完全な変更日記: v1.0.0...v1.1.0

E
ExLlamaV3 AI v1.0.0

1.0.0

-> 図表の小さな書き込み。Flash-attention-2 と xformers の依存関係を削除 オンラインキャッシュの量子化、SWA 層と注意槽の二重入力を持つ新しい注意カーネル 新しい conv1d カーネル (causal_conv1d のサポート/必要性を削除) Ampere の GEMM/GEMV 性能が大幅に改善 ニュー INT8 GEMV カーネル 新しい MoE カーネルチケットスケジューラー すべての attn/GDN モジュールのグラフ経路 融合したサンプリングカーネル。..

E
ExLlamaV3 AI v0.0.43

0.0.43

TPモードで MTP 作成時のエラーを修正 迅速なクワニゼーション フル チェンジログ: v0.0.42...v0.0.43

E
ExLlamaV3 AI v0.0.42

0.0.42

MTPモデルがターゲットモデルの出力デバイスにないときに MTP 作成を修正します 完全な変更日記: v0.0.41...v0.0.42

E
ExLlamaV3 AI v0.0.41

0.0.41

Qwen3.5/3.6 の MTP サポートを追加しました 全変更日記: v0.0.40...v0.0.41

E
ExLlamaV3 AI v0.0.40

0.0.40

サポート Gemma4UnifiedForConditionalGeneration 完全な変更ログ: v0.0.39...v0.0.40

E
ExLlamaV3 AI v0.0.39

0.0.39

Step3p7ForConditionalGenerationを追加する 完全な変更ログ: v0.0.38...v0.0.39

E
ExLlamaV3 AI v0.0.38

0.0.38

Lfm2MoeForCausalLM (LFM 2.5) をサポートする bsz > 1 のとき GDN 推論の回帰を修正 cudaMallocAsync バックエンドが使用されたときに TP モードで DFlash が破損する問題を修正 QoL 改善 全変更日記: v0.0.37...v0.0.38

E
ExLlamaV3 AI v0.0.37

0.0.37

もう1つの小さなバグ修正 完全な変更ログ: v0.0.36...v0.0.37

E
ExLlamaV3 AI v0.0.36

0.0.36

小規模なSD回帰を修正 完全な変更ログ: v0.0.35...v0.0.36

E
ExLlamaV3 AI v0.0.35

0.0.35

Qwen3.5/3.6用のテンサー並行モード 新しいリキュレント状態マネージャー リキュレント状態のダイナミクス割り当てを避ける (断片化を軽減し、Qwen3.5のVRAMオーバーヘッドを恒定に保つなど) 利用可能なキャッシュスペースをよりよく利用するための改善されたチェックポイント決定 大層のスライスで再構築-GEMMを実行し、VRAMオーバーヘッドを大幅に削減する ストリーミングトークン出力を遅らせるレース状態の修正。..

E
ExLlamaV3 AI v0.0.34

0.0.34

プリフィール中にVRAMの使用を増やすリグレッションを修正 CUDA 13.2.0ホイールを追加 (火花に対してcu132で構築==2.11.0+cu130) 全変更日記: v0.0.33...v0.0.34