E

ExLlamaV3

E
ExLlamaV3 AI v1.3.0

1.3.0 開発

DeepseekV3の初期サポート (JoyAI-LLM-FlashとMoonlight-16B-A3Bに対して検証、ルーティンググループはまだない) 2階層CPU K/Vキャッシュ、よりインテリジェントなページとチェックポイント退出ポリシー Freq/rep 修正。XTCサンプラーとトークン禁止の長期文脈の遅延を引き起こす罰 セキュリティーセンサの読み込みの潜在脆弱性を軽減 他のバグ修正、最適化、QoLの改善 Ful...

E
ExLlamaV3 AI v1.2.1

1.2.1 開発

より速い量子化 Windows: JITコンパイルエラーと壊れた CPUオフロードパフォーマンスの修正 多トークン文字の終わりと始まりの両方のトークンの解読を壊すトークナイザー問題の修正 (韓国語スペシャル) 完全な変更日記: v1.2.0...v1.2.1

E
ExLlamaV3 AI v1.2.0

1.2.0 農業について

LagunaForCausalLM (およびDFlashLagunaForCausalLM) のサポート 専門家層の実験的なCPUオフロードサポート 実験的なダイナミック・ドラフトウィンドウ機能 改善されたセーフェテンサーの読み込み (より速く) より多くのグラフ経路 性能チューニング compare_q.pyを削除し、qbench.pyで置き換えられた 様々なバグ修正 完全変更日記: v1.1.0...v1.2.0

E
ExLlamaV3 AI v1.1.0

1.1.0 について

HYV3ForCausalLMをサポートする TPモードのCPUオーバーヘッド削減とネイティブバックエンドのプレフィールパフォーマンスの改善 トーチ。マルチノミアルの暗黙の断片処理動作に一致するようにトップ-P=1サンプリングを調整する 繰り返しモデルでサポートされている禁止文字列 バグ修正とQoLの改善 完全な変更日記: v1.0.0...v1.1.0

E
ExLlamaV3 AI v1.0.0

1.0.0

-> 図表の小さな書き込み。Flash-attention-2 と xformers の依存関係を削除 オンラインキャッシュの量子化、SWA 層と注意槽の二重入力を持つ新しい注意カーネル 新しい conv1d カーネル (causal_conv1d のサポート/必要性を削除) Ampere の GEMM/GEMV 性能が大幅に改善 ニュー INT8 GEMV カーネル 新しい MoE カーネルチケットスケジューラー すべての attn/GDN モジュールのグラフ経路 融合したサンプリングカーネル。..

E
ExLlamaV3 AI v0.0.43

0.0.43

TPモードで MTP 作成時のエラーを修正 迅速なクワニゼーション フル チェンジログ: v0.0.42...v0.0.43

E
ExLlamaV3 AI v0.0.42

0.0.42

MTPモデルがターゲットモデルの出力デバイスにないときに MTP 作成を修正します 完全な変更日記: v0.0.41...v0.0.42

E
ExLlamaV3 AI v0.0.41

0.0.41

Qwen3.5/3.6 の MTP サポートを追加しました 全変更日記: v0.0.40...v0.0.41

E
ExLlamaV3 AI v0.0.40

0.0.40

サポート Gemma4UnifiedForConditionalGeneration 完全な変更ログ: v0.0.39...v0.0.40

E
ExLlamaV3 AI v0.0.39

0.0.39

Step3p7ForConditionalGenerationを追加する 完全な変更ログ: v0.0.38...v0.0.39

E
ExLlamaV3 AI v0.0.38

0.0.38

Lfm2MoeForCausalLM (LFM 2.5) をサポートする bsz > 1 のとき GDN 推論の回帰を修正 cudaMallocAsync バックエンドが使用されたときに TP モードで DFlash が破損する問題を修正 QoL 改善 全変更日記: v0.0.37...v0.0.38

E
ExLlamaV3 AI v0.0.37

0.0.37

もう1つの小さなバグ修正 完全な変更ログ: v0.0.36...v0.0.37

E
ExLlamaV3 AI v0.0.36

0.0.36

小規模なSD回帰を修正 完全な変更ログ: v0.0.35...v0.0.36

E
ExLlamaV3 AI v0.0.35

0.0.35

Qwen3.5/3.6用のテンサー並行モード 新しいリキュレント状態マネージャー リキュレント状態のダイナミクス割り当てを避ける (断片化を軽減し、Qwen3.5のVRAMオーバーヘッドを恒定に保つなど) 利用可能なキャッシュスペースをよりよく利用するための改善されたチェックポイント決定 大層のスライスで再構築-GEMMを実行し、VRAMオーバーヘッドを大幅に削減する ストリーミングトークン出力を遅らせるレース状態の修正。..

E
ExLlamaV3 AI v0.0.34

0.0.34

プリフィール中にVRAMの使用を増やすリグレッションを修正 CUDA 13.2.0ホイールを追加 (火花に対してcu132で構築==2.11.0+cu130) 全変更日記: v0.0.33...v0.0.34