L

LMDeploy

L
LMDeploy AI v0.15.0

v0.15.0

変更点 機能 サポート ロングコンテキストとMTPプレフィックスキャッシュヒット @grimoire in #4688 [機能] 推論的な解読のサポートを追加 @windreamer in #4559 feat ((turbomind): メモリーアロケーター、オブジェクトキャッシュ、スケジューラー統合 by @lzhangzz in #4717 feat: AgRs all2allバックエンドを追加 @irexyc in #4739 DeepSeek V4 サポート @grimoire in #454 サポート memdecode by @lvhan0...

L
LMDeploy AI v0.14.0

v0.14.0

変更点 機能 FP8 kvキャッシュ量子化 @CUHKSZzxy in #4563 サポート Qwen3 Omni by @CUHKSZzxy in #4411 サポート qwen3.5 ((vit) 推論 in turbomind backend by @irexyc in #4602 OpenAI応答対応エンドポイントを追加 @CUHKSZzxy in #4582 追加 /get_pplエンドポイント by @irexyc in #4679 改善 @lzhangzz by @lzhangzz in #4557 リファクターturbomind): コンソール。..

L
LMDeploy AI v0.14.0a2

v0.14.0a2

変更点 機能 FP8 kv キャッシュ量子化 @CUHKSZzxy in #4563 サポート Qwen3 Omni @CUHKSZzxy in #4411 サポート qwen3.5 ((vit) 推論 in turbomind backend @irexyc in #4602 OpenAI応答対応エンドポイントを追加 @CUHKSZzxy in #4582 改善 @lzhangzz in #4557 リファクタールでターボマインドモデリングインフラストラクチャを更新する: CUDA エラー処理を統合し、マニュアル s を追加する。..

L
LMDeploy AI v0.14.0a1

v0.14.0a1

変更点 機能 FP8 kvキャッシュ量子化 @CUHKSZzxy in #4563 改善 更新 @lzhangzz in #4557 refactor ((turbomind) のターボマインドモデリングインフラストラクチャ: CUDA エラー処理を統合し、手動スタックトレーシングを追加 @lzhangzz in #4565 追加 Qwen3.5 Moe lite awq by @43758726 in #4561 [改善]: 睡眠エンジンのときに排水列を @RunningLeon in #4577 拡張 チャット完了 int...

L
LMDeploy AI v0.13.0

v0.13.0

変更点 機能 [Ascend] qwen3.5 35BA3B をサポートする @wanfengcxz in #4485 feat: #4510 で @windreamer で KV Cache 量子化のための TurboQuant (quant_policy=42) サポートを追加する [リファクタ] [api_server] [2/N] #4548 で @lvhan028 で xml パッサーを抽象化することによってツールパーサーを改善する feat ((turbomind): 複製メモリを最適化した Blackwell GPU で Qwen3.5 MoE 推論のための cublasGemmGroupedBatchedEx を統合する。..

L
LMDeploy AI v0.12.3

v0.12.3

変更点: #4360 で @CUHKSZzxy によるビデオ入力をサポートする Feat: #4429 で @lapy による TurboMind で gs32 の圧縮テンソールサポートを完全に実装する #4429 で @CUHKSZzxy による Params の設計モデル更新 #4452 で ####################################################################################################################################################################################

L
LMDeploy AI v0.12.2

v0.12.2

変更点 機能支持 glm5 by @grimoire in #4355 Qwen/Internlm/Llama Dense/Moe model fp8 quant online by @43758726 in #4324 Qwen3.5 by @grimoire in #4351 GLM-4.7-Flash Turbomind サポート by @lapy in #4362 ルーターの再プレイをサポートし、qwen3.5 の量子層を無視する @RunningLeon in #4394 [機能] Qwen3.5 モデル (密度 + MoE) の TurboMind サポートを追加する @lapy in #4389 サポート 繰り返し。..

L
LMDeploy AI v0.12.1

v0.12.1

変更点 機能支持 glm-4.7-flash by @RunningLeon in #4320 [ascend]suppot ep by @yao-fengchen in #3696 改善修正 トランスフォーマー v5 by @grimoire in #4303 トランスフォーマー5 by @grimoire in #4345 #4345 のカスタムノアックスカーネルを追加 @RunningLeon in #4297 の量子コンフィギュレーションの層を無視するサポート

L
LMDeploy AI v0.12.0

v0.12.0

変更点 機能 ターボマインドにGloo通信を追加 @irexyc in #3362 [Feat] トルボマインドで llm-コンプレッサー AWQモデルをサポート @43758726 in #4290 Gpt ossのルーター再プレイをサポート @RunningLeon in #4298 トルボマインドで llm-コンプレッサー対称量子モデル推論をサポート @43758726 in #4305 Intern-S1-Proをサポート @CUHKSZzxy in #4318

L
LMDeploy AI v0.11.1

v0.11.1

変更点 機能 [上昇] サポート dptp by @tangzhiyi11 in #4218 サポート Deepseek v32 by @grimoire in #4026 改善 @CUHKSZzxy in #4178 デミー入力のためのリザーブブロックを改善 @grimoire in #4157 Qwen3-VL by @CUHKSZzxy in #4183 のビジョンIDを追加 [強化]: 要求がキャンセルされたときにルーティングされた専門家を返信 @RunningLeon in #4197 @CUHKSZz...

L
LMDeploy AI v0.11.0

v0.11.0

変更点 機能追加エンドポイント /abort_request by @lvhan028 in #4092 Qwen3 next by @grimoire in #4039 サポート Qwen3-VL by @CUHKSZzxy in #4093 サポート シンクロ重量 プレートバケットテンソール by @RunningLeon in #4109 サポート グループルーター for moe models by @RunningLeon in #4120 [機能]: ルーティングされた専門家を返信 @RunningLeon in #4090 サポート コンテキスト @irexyc in #3951 fop...