v0.34.2
変更は? llama.cppの更新 全変更日記: v0.34.1...v0.34.2-rc0
変更は? llama.cppの更新 全変更日記: v0.34.1...v0.34.2-rc0
llama.cppビルド変更により libllama と libmtmd の間に重複したシンボルが生じた。このパッチをリブラマに移動し、出荷したシンボルを表示します。
MLXのセーフティセンサは 実験用ではないGGUFモデルの作成には、Safetensor変換と量子化のために llama.cpp ツールを使用する必要があります。Apple Silicon Runaway の重複トークン検出における MLX メモリー処理の改善により、誤陽性値 (例えば、OCR) /api/tags は大きなモデルライブラリではるかに速く (3.1 s → 294 ms 冷たいテスト),...
typical_p パラメータで新しいモデルを作成するためのサポートを削除し、設定で既存の GGUF モデルをサポートします。
mlx: docker ビルド コンテキストに mlx パッチを追加 (#18440)
MLX: バージョンバム mlx: サポート ModelOpt MoE モデルのグローバルスケール アドレス コメント アドレス コメント
Ollama モデルを ChatGPT デスクトップで直接使用できますので、オープンなモデルを実行している間に既存のワークフローを維持できます。MacOS の Ollama アプリからインストールできます。このリリースでは、Apple Siliconの構造化出力性能も向上し、OpenAI対応のクライアントツール検索とレスポンスコンパクトのサポートも追加されています。完全な変更ログ: v0.33.3...v0.34.0
openai: スタンドアロン名前の関数出力 (#18348) をサポートする
proxy: Full Access (#18331) で名前空間のコマンドを正規化する
openai: plaintextでラベルされたCodexエージェントメッセージ (#18329) を受け入れる
openai: Web 検索の制限 (#18328) で回答を完了する
app: harden Codex デスクトップ プロキシ処理 (#18244)
app: Ollama を ChatGPT デスクトップに追加する (#18236)
変更点 gemma4 は、MLX エンジンで画像とオーディオをサポートしています。 報告キャッシュされたプロンプトトークン Honor GGUF モデル 定義 デフォルトパラメータ MLX,MLX-C,lama.cpp 更新 新しい貢献者 @marcelpetrick は、#17579 に最初の貢献をしました。 完全な変更日記: v0.33.2...v0.33.3
機体MLXが対応するセーフテンサーは 画像と音声のチャットに対応します画像は両ビジョンアーキテクチャ:トランスフォーマータワー (26B,31B,eシリーズ) と12Bのエンコーダーフリー統一エンベッダーを通過する。画像フィールドの gemma4 GGUFs WAVバイト、OpenAI input_audioパーツ、および /v1/audio/transcriptions アップロード。..
llama.cpp: バージョン バンプ b10760 (#18199)
llama.cpp: バージョンブンプ b10729 b10729 のコンパットフックパッチを再生成する: 上流は読み取るために全テンサールード_データ_を削除した (最後のユーザーは llama-quantize で、現在 load_data_range を通してスレイブを読み取っています).既存のフック表面 (コンストラクター、スキップループ、ロード_オール_データ、mtmd/クリップ) を変更せずに maybe_load_text_tensor_range を追加し、テンソール a に対して 1 回テキストロード オプの出力を実現します。..
変更 Ollama のアプリは、再びシステム表示をフォローし、ダークモードのサポートを復元しました MacOS アプリの修正で、もう2つ目のインスタンスを起動するのではなく、すでに実行中のインスタンスを適切に転送しました Claude Desktop プロキシは、モデルカタログが更新されたときに飛行中のリクエストを中断しません。 完全な変更日記: v0.33.1...v0.33.2
app: Claude (#18077) のアカウントクラウドモデルのリスト
app: macOS アプリの手渡しを同期する (#18056)
変更点 MLX: Qwen3.8 Flash 次のサポート cmake: 外部コンパクトパッチを idempotent MLX と llama.cpp にする mlxrunner 更新 mlxrunner: 構造化出力サポートを追加 mlxrunner: 遅いストレージからモデルをロードする際にMetal GPUのタイムアウトを避ける 新規貢献者 @pd95 は#17948 に最初の貢献をしました 完全な変更日記: v0.33.0...v0.33.1
新しいcmakeの共通ユーティリティが欠けている。
Qwen3.8 Flash 次のサポートレビューコメント
Claude Desktopの開発者は、 Claude Desktop を簡単に設定し、 Ollama を第三者のゲートウェイ プロバイダーとしてシームレスに動作させることができます。改善されたキャッシング 長いプレフィールをキャンセルするエージェントクライアントが再起動する代わりに停止した場所に再起動するため、キャンセルされたプレフィールがすべての復元点を保持する。
proxy: イメージフォールバック (#18002) の間には文字列の内容を保存する
app: Claude Desktop のモデルマッピング (#17979) を追加する
app: アプリのタイトルバーの重複を防止する (#17925)
app: 標識モデル推奨エンドポイント (#17919)
アプリ:クラウドモデル管理 (#17915)
変更点 初起動時の新しいデスクトップオンボードフロー キャッシュは要求間のモデルメタデータを解決し、最初のトークンまでの時間を約半減 (TTFTはベンチマークで ~995 ms から ~524 ms に低下) 交談と生成がミッドストリームパーサーエラーの後でクイーンになる可能性があるバグを修正 Qwen 3.8 システムメッセージは現在正規化されているため、リードでないシステムメッセージは一貫してMLXとlama.c...