v0.32.5
何が変わったか MLX メタルバグを修正しました NVFP4モデル、特にラグナで出力品質を低下させる可能性があります完全な変更ログ: v0.32.4...v0.32.5
何が変わったか MLX メタルバグを修正しました NVFP4モデル、特にラグナで出力品質を低下させる可能性があります完全な変更ログ: v0.32.4...v0.32.5
mlx更新 (#17397)
What's Changed アップル GPU で Laguna をサポート MLX エンジン による 予測式解読・ドラフトを作成する際に要求されたタイプでドラフトモデル出力ヘッドを量子化する異なる量子化専門家のための固定Qwen3 MoE解読、さらにより速いパックゲート/アッププロジェクション (M5 Maxで~49%).全変更ログ: v0.32.3...v0.32.4
モデル: Laguna MLX サポートを追加する MLX モデルに Laguna XS 2, XS 2.1,および S 2.1 サポートを追加し、経路を作成する。密度の高い MoE 層とルーティングされた MoE 層に 1 つの量子化ポリシーを適用するためにソースの設定を読み取ります。接続された出力ヘッドとルータを 精度で保持し サポートされた注意と専門家プロジェクションを量子化し 敏感な専門家ダウンプロジェクションを 選択的に促進し
撤回された場合は、0.32.3または新しいものを使用してください
データを送信する前に停止します。統合が改善されました クロード・コード・チャネルを復元し 人工思考の流れを修正し ヘルメスのデスクトップを尊重させましたWindows ARM64 で CUDA をサポートする GPU の拡張、CUDA 12 で B200 のサポート、Linux の CUDA/ROCm iGPU でメモリ使用量の削減。Laguna 2.1 モデルへのチャット、思考、ツールコールサポートを追加。..
llama.cpp を更新して、上流の Laguna 実装を取り上げ、Ollama のローカル Laguna 実装を削除します。細かい金属のみのスケーリングを保持して 経路されたMoEの即時溢出を古い Ollama GGUF 注意門と SWA メタデータ名を翻訳して、既存のモデルが読み込みを続けます。
これは、既存の統合テストを 3つのプライマリグループに分けます。 迅速、リリース、ライブラリ。また、リリーステストの一部を改良し、古いモデルを削除し、新しいモデルをピックアップし、ライブラリグループの幅広いカバーを維持します。
WoA を交差編みするために必要なもの
サーバ:最初のバイト前にダウンロードストールを検出 サーバ:ダウンロードAPIからストールタイムアウトを保持
Linux CUDA v12プリセットに計算能力 10.0 を追加して、B200 クラスデバイスは CUDA v13 最低値を満たしていないドライバで cuda_v12 バックエンドを使用できます。修正 #12583
変更点 Gemma 4 ツール呼び出しと多ターン推論の改善、より信頼性の高いツール応答の継続を含む MLX モデルのキャッシュの漏れが修正され、リクエスト間でメモリ使用を増やすことができ、キャッシュのスナップショットの性能が改善されました MLX テキストモデルの読み込みは、OLLAMA_LOAD_TIMEOUT エージェントのウェブ検索と取得を尊重し、認証が必要なときにユーザーに ollama signin を実行するように指示します。..
cmd: システムプロンプト (#17188) に現在の作業 dir を置く
新しいインタラクティブなエージェント体験: ollama を実行すると、コードを作成し、作業を委任するのに役立つエージェントが起動します ollama Ollama 0.32.0 ▸ チャット、コード、&ワーク (glm-5.2:クラウド) モデルとチャット、コード、ウェブ検索、実際の作業を委任 コデックスアプリ統合をChatGPTに改名: ollama を使用してchatgptを起動します (そして --復元して通常の ChatGPT プロファイルに戻る) 簡素化された統合選択。..
cmd: エージェント UI (#17017)
変更点 古いNVIDIA GPU (コンピューティング能力 6.x) のフラッシュ注意を有効にした。 iGPUは、現在、可用メモリに合うようにパッディングを付いたビジョンモデルをオフロードできる。 思考が無効になったとき思考モデルのための固定構造化出力。 硬化されたGGUFモデル作成 オルラマ クラウドコードの起動は、現在デフォルトでテレメトリを無効にする。 UTF-8 文字以外の経路上のロードモデルを固定した。 MLXとラムを更新した。..
llm: マルチモダルのプロジェクタをロードする前に、iGPU mmprojを fit padding llama.cppの fit pass サイズテキストモデル配置でオフロードさせてください。Ollamaは、プロジェクタの完全オフロードを無効にし、プロジェクタに十分なメモリが利用可能であっても、GB10とStrix HaloのCPUにCLIPを強制することで、非金属iGPUでのリスクを回避していた。統合されたGPUは 他の。..
mlx: de7b4ed9 (#17056) に更新
Apple SiliconでGemma 4がより速くGemma 4はApple SiliconでOllamaでより速く、マルチトークン予測 (MTP) を活用することで、コーディングエージェントベンチマーク全体で平均で約90%早くトークンを生成しています。Ollamaは実行中に何トークンをドラフトするかを自動調節します。 そのため、スピードアップはデフォルトでオンになり、設定は必要なく、モデルの出力を変更しません。何が変わったんだ?
スタート: Hermes デスクトップのminバージョンをチェック (#16912)
変更されたツール: JSON 文字列内の括弧を無視する ツールコール終了 @aditya-786 in #16937 mlx: バンプ依存 by @dhiltgen in #16935 llama.cpp更新 by @dhiltgen in #16960 新しい貢献者 @aditya-786 は #16937 に最初の貢献をしました 完全な変更ログ: v0.30.11...v0.30.12-rc0
What's Changed 開始: @hoyyeva in #15434のオープンコードに思考能力検出を追加開始: #16802のオープンコードで@hoyyevaのクロードコードを自動インストール開始: #16806のオープンコードで@hoyyevaが欠けている場合、自動インストール開始: #16791のオープンコードで@jessegrossの予想解読を統一し調整する: #16669のハイブリッドグラフィック上のWindowsのinverted iGPU/dGPU Vulkan分類を修正する
パサー/レンダリング: Ornith 9B レンダリング/パーサーのサポートを追加 (#16920)
llama.cpp バージョン更新 (#16548)
変更点 コマンドAとノースファミリーのモデルは、現在MLXエンジンでApple Siliconで動作している。 9672のビルドのために基礎となる llama.cppエンジンを更新した。 MLXのビルドアーティファクトを修正した。 全変更日記: v0.30.9...v0.30.10
ci: pinダーウィンのリリース xコード (#16788)
llama: llama.cpp を b9672 (#16775) に更新する
Cohere2Moeアーキテクチャへのサポート変更 思考が発信されなかったケースの LFM2 パサー/レンダリングが修正されました ollama 起動 claude および他のコーディングエージェントまたはアシスタントの使用ケースが1つのトークンしか出力しない問題修正 Ollama は、単一のメッセージが現在のコンテキストウィンドウよりも大きい場合はエラーを返します Full Changelog: v0.30.8...v0.30.9-rc1