L

llama.cpp

L
llama.cpp AI

B11009

TP: 融合したQKV gemma4の分割状態と粒子を固定する qwen35 (#28965) モデル: 融合したQKV gemma4で必要なn_head * n_embd_head_kからattn_qkvの分割状態を計算する --fuse-qkv,n_embdは5376,Qは8192.モデル: qwen35/qwen35moeの融合した全注意層を扱うモデル: TODOを追加: [TAG_SPLIT_QGATE_QWEN] ウェブサイト: https://llama.app 認定: https://github.com/ggml-org/llama.cpp/...

L
llama.cpp AI

b11007

MTPドラフト (#28549) の CUDAグラフを有効にする MTP グラフの使用を改善する MTP フィールドの名前を変更する アドレスレビューフィードバック ウェブサイト: https://llama.app アテストメント: https://github.com/ggml-org/llama.cpp/attestations: https://github.com/ggml-org/llama.cpp/attestations/47982528 macOS/iOS: macOS Apple シリコン (arm64) macOS Apple シリコン (arm64, KleidiAI有効) ディSABLED macOS Intel (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU...

L
llama.cpp AI

b11006

hexagon: K-Quants Q4_K と Q6_K (#28994) のサポート q6k/q4k カーネルを実装する クラッシュした: feat: q6k カーネルを実装する hex-q6k: 解包精度を向上させる hex-q4_k: Q4_K カーネルをサポートする 共同著者: Max Krasnyansky maxk@qti.qualcomm.com ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47977588 macOS/iOS: macOS Apple Silicon (arm64) macOS Apple S...

L
llama.cpp AI

b11005

hexagon: supports_op (#28995) のゼロドロープ探査機を受け入れ、すべてのパラームが0であるロープでラマ探査機の重量配置を行う。したがって、n_dims == 0またはfreq_base == 0を拒絶すると、CPUにロープ_freqsを配置する。解読グラフを2つに分割します。 5つに分割します。支援:クロード・オプス5 ウェブサイト: https://llama.app 認定: https://github.com/ggml-org/llama.cp...

L
llama.cpp AI

b11003

モデル: HrmTextForCausalLM (DFM Mimir 1B) (#27625) のサポートを追加 モデル: HrmTextForCausalLM (DFM Mimir 1B) のサポートを追加 HRM-Textは、同じトークンストリームで交互サイクルで2つのトランスフォーマースタック (低、高) を実行します。低サイクルの状態 z_l は、学習した [n_embd] テンソールから始まり、位置にわたって放送される。変換: 融合した gqkv 投影 (オーダーゲート、q,k,v) の新しいライター 再マッピング。..

L
llama.cpp AI

b11002

CUDA/HIP: im2col (#28013) のアクセスパターンを改善する Web サイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47937267 macOS/iOS: macOS アップル シリコン (arm64) macOS アップル シリコン (arm64, KleidiAI有効) 障害 macOS Intel (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) arm64 (Vulkan) Ubuntu x64 (CU...

L
llama.cpp AI

B11001

spacecemit: int16データ (#25161) の誤ったトランスポーズ関数を修正する permute_transpose_impl にある sizeof(int16_t) 支線は rvv_transposed_s32_mn_to_nm の代わりに rvv_transposed_s16_mn_to_nm を呼び出す。これは、その上の int32_t のサイズからコピー・ペーストバグです。s32関数は32ビットセグメントロード/ストレージ (vssseg8e32.v) を16ビットデータで使用し、要素ごとに2xバイトを読み出し、完全に間違ったトランス。..

L
llama.cpp AI

B11000

rpc: 参照されたバッファが解放されたときにキャッシュされた計算グラフを無効にする (#24292) サーバーは、デバイスごとに最新の計算グラフをキャッシュして、GRAPH_RECOMPUTEがテンソールデータを再送信せずにそれを再実行することができます。キャッシュされたグラフノードは、graph_compute() 時に起動していたバックエンドバッファへの直接ポインタを保持します。次のGRAPH_RECOMPUTEは。..

L
llama.cpp AI

b10999

統一KV (#28849) と自動フィットするための最大コンテキスト長を変更する ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47906437 macOS/iOS: macOS Apple シリコン (arm64) macOS Apple シリコン (arm64,KleidiAI有効) DISABLED macOS Intel (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) Ubuntu arm64 (Vulkan)...

L
llama.cpp AI

b10998

qwen4exp: add hc ops (#28901) ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47897353 macOS/iOS: macOS アップル シリコン (arm64) macOS アップル シリコン (arm64, KleidiAI有効) ディSABLED macOS インテル (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu arm64 (Vulkan) Ubuntu arm64 (Vulkan) Ubuntu arm64 (CUDA 12) - CUDA 12.8 Ubuntu...

L
llama.cpp AI

b10997

HIP: RDNA3.5 アーキテクチャ (#28935) で MoE ncols_opt タイル ヒューリスティックを拡張する。このコード変更は ggml/src/ggml-cuda/mmq.cu で実行され、条件では GGML_CUDA_CC_IS_RDNA3_0 を GGML_CUDA_CC_IS_RDNA3 に変更するだけです密度の高い配送論理は変わらないテストマシンの構成。..

L
llama.cpp AI

b10996

chat: force \n</think> on reasoning budget end for qwen3-coder (#28869) ウェブサイト: https://llama.app 認定: https://github.com/ggml-org/llama.cpp/attestations/47858837 macOS/iOS: macOS アップル シリコン (arm64) macOS アップル シリコン (arm64, KleidiAI有効) ディSABLED macOS Intel (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) Ubuntu arm64 (Vulkan...

L
llama.cpp AI

b10995

vulkan: MUL_MAT_ID BN/2 の尾を無条件にする (#28923) BNover2 のデフォルトとして BN/2 を使用し、 BNover4 のデフォルトとして BN/2 を使用し、MUL_MAT_ID BN/2 のブランチから enable ゲートを削除する。BN/4ブランチは enable_smaller_matrices によってゲートされ、p.N パスが変更されません。ウェブサイト: https://llama.app 認定: https://github.com/ggml-org/llama.cpp/attestations/47850603 macOS/iOS: ma...

L
llama.cpp AI

b10994

テストバックエンド-ops: f16を超えたアクティベーションのために MUL_MAT_ID NaN を再現します。 Metal mul_mm_id パスは、simdgroup MMA の src1 を半分に絞ります (S1 = すべてのインスタンシアーションで半分; ggml-metal.metal:10582 と :10595,テンソール-ops で :10643/:10654 に反映されています).f16は65,504で飽和しているので 活性化量がそれ以上のモデル。..

L
llama.cpp AI

b10993

ci: hf-jobs (#28712) に自主ホストのwebgpuを追加 t4-medium cont を試して hf-jobs に自主ホストのvulcan と webgpu を追加: cpu バックエンドスレッドを調整して t4-small を再試して cm ワークを復元 共同著者: Georgi Gerganov ggerganov@gmail.com ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47838838 macOS/iOS: macOS Apple シリコン (arm64) macOS Apple シリコン (arm64, Klei...

L
llama.cpp AI

b10992

llama-bench: サポート -- バージョンをプリントするビルド情報 (#28971) ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47831792 macOS/iOS: macOS アップル シリコン (arm64) macOS アップル シリコン (arm64, KleidiAI有効) ディSABLED macOS Intel (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) Ubuntu arm64 (Vulkan) Ubuntu...

L
llama.cpp AI

b10991

hexagon: missing contiguous fast-path と hvx_copy_uu を各実行で追加する (#28886) ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47775478 macOS/iOS: macOS Apple シリコン (arm64) macOS Apple シリコン (arm64, KleidiAI有効) 障害 macOS Intel (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) Ubun...

L
llama.cpp AI

b10990

hex-cpy: src と dst が隣接している場合は dma を使用します (#28906) ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47770889 macOS/iOS: macOS Apple シリコン (arm64) macOS Apple シリコン (arm64, KleidiAI 有効) DISABLED macOS Intel (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) arm64 (Vulkan) Ubuntu x64...

L
llama.cpp AI

b10989

HIP: ROCm (#27825) のためにAllReduceを有効にする ウェブサイト: https://llama.app 証明書: https://github.com/ggml-org/llama.cpp/attestations/47762387 macOS/iOS: macOS アップル シリコン (arm64) macOS アップル シリコン (arm64, KleidiAI有効) ディSABLED macOS インテル (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) Ubuntu arm64 (Vulkan) Ubuntu x64 (CUDA 12) - CUDA...

L
llama.cpp AI

b10988

opencl: spekulative decoding/MTP (#27637) のためのバッチサイズによってMoE専門家matmulを選択 opencl: ルーティングカウントで事前構築されたq4_0 MoE GEMMをゲート opencl: 押し付けられたMoEアクティベーションスロットにゼロを書くのをやめ opencl: claudeのコメントを書き換える Co-authored-by: Li He lih@qti.qualcomm.com ウェブサイト: https://llama.appestations: https://github.com/ggml-org/llama.cpp/attestations/47713087 macOS/iOS:...

L
llama.cpp AI

b10985

rpc:ハッシュキャッシュのみの重み (#28789) rpc:ハッシュキャッシュのみの重み ggml_backend_rpc_buffer_set_tensor と ggml_backend_rpc_set_tensor_async は、HASH_THRESHOLD 以上のすべての転送をハッシュし、rpc-server -c がファイルキャッシュからそれを提供できるようにします。バックエンド間の ggml_backend_sched コピーのアクティベーションは同じ経路をとった。 Qwen3.8-Flash-Nextの2ノード分割で。..

L
llama.cpp AI

b10984

cuda: support row-contiguous SUM_ROWS (#26308) cuda: support row-contiguous SUM_ROWS コードを整理し、同じ共有カーネルを使用して行隣接テンソーをサポートするためにGGML_OP_MEANを追加し、MEANへのテストを追加します。 元のコメントを維持し、if/elseブランチを追加します。 ウェブサイト: https://llama.app Attestations: https://github.com/mlgg-org/llama.cpp/attestations/47632927 macOS/iOS: macOS Apple Silic...

L
llama.cpp AI

b10983

モデル: グラフとグラフテンプレートのスペシャライゼーションが明示的に定義された後に build_arch_graphの関数定義を移動します。ウェブサイト: https://llama.app 認定: https://github.com/ggml-org/llama.cpp/attestations/47624834 macOS/iOS: macOS アップル シリコン (arm64) macOS アップル シリコン (arm64, KleidiAI有効) DISABL...

L
llama.cpp AI

b10982

vulkan: Sparse Flash Attention (#28105) をサポートする。 vulkan: DSV4/GLM 調律実装のための Sparse Flash Attention をサポートする。 テストを追加する。 非決定的な原子を避ける。 cm2 解読ベクトルサポートを追加する。 論理を簡素化し、変数名をより一貫性のあるものにする。 解読ベクトルに対する cm2 f16vec4 結合を追加する。 ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47615058 macOS...

L
llama.cpp AI

b10981

OpenVINO: ステートフルデコードとGPU MoE推論 (#28638) を最適化する GPU/NPUを排除する POOL_2Dケース プールケースを修正 ggml-openvino: Gemma-4のステートフルデコードを修正する 各層型ヘッドサイズ ggml-openvino: permute ggml-openvinoにおける MSVC収縮エラーを修正する: スライディングウィンドウ層を構造的に交差したSWAモデルに分類する ggml-openvino: GGML_OPENVINO_REQUANT_KQUANTを追加して4ビット要求者を選択する。..

L
llama.cpp AI

b10980

opencl: add generic ssm_scan (#28881) opencl: add generic ssm_scan opencl: fix whitespace ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47601188 macOS/iOS: macOS アップル シリコン (arm64) macOS アップル シリコン (arm64, KleidiAI有効) ディSABLED macOS インテル (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan)...

L
llama.cpp AI

b10978

metal: HSK=96, HSV=64 (MiniCPM3) (#28599) のFAカーネルを追加 metal: HSK=96, HSV=64 (MiniCPM3) のFAカーネルを追加 MiniCPM3は attention.key_length を 96 に設定し、 attention.value_length を設定しません。デフォルトでは n_embd / n_head = 64 です。メタルは (96, 64) のインスタンス化がないので、 -fa は欠落したカーネル_フラッシュ_アットン_ext_vec_f16_dk96_dv64 で自動中止されました。96,64でタイルカーネルをインスタンスします。

L
llama.cpp AI

b10977

ci: バンプ CUDA Windows x64ビルド 13.4.1 (#28930) ウェブサイト: https://llama.app 認定: https://github.com/ggml-org/llama.cpp/attestations/47583571 macOS/iOS: macOS アップル シリコン (arm64) macOS アップル シリコン (arm64, KleidiAI有効) ディSABLED macOS Intel (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) arm64 (Vulkan) Ubuntu x64 (CUD...

L
llama.cpp AI

b10976

ci: fix android release (#28936) ウェブサイト: https://llama.app Attestations: https://github.com/ggml-org/llama.cpp/attestations/47548995 macOS/iOS: macOS アップル シリコン (arm64) macOS アップル シリコン (arm64, KleidiAI enabled) ディSABLED macOS インテル (x64) iOS XCFramework Linux: Ubuntu x64 (CPU) Ubuntu arm64 (CPU) Ubuntu s390x (CPU) Ubuntu x64 (Vulkan) Ubuntu arm64 (Vulkan) Ubuntu x64 (CUDA 12) - CUDA 12.8...