Ollama Turbo Quant

Ollama Turbo Quantは、turbo-quantが提供するベクトル量子化機能(符号化、デコード等)を使って、Ollamaからの出力を後処理できるローカルLLM支援ツールです。

概要

Ollama Turbo Quantは、ローカルLLM(Ollama)との対話を支援するWebツールです。turbo-quantライブラリのベクトル量子化機能を活用し、LLMレスポンスの変換・圧縮・品質改善を実現します。

Ollama Turbo Quant

2つのモード

non-Turbo

ポート: 3000

Ollamaとの連携のみ

Turbo

ポート: 3001

Ollama + Turbo-Quantによるレスポンス処理

主な機能

Prompt編集: Monaco Editorによる高度なテキスト編集
ストリーミング生成: WebSocket経由でのリアルタイムLLM出力
モデル選択: Ollamaに登録されているモデルの一覧表示・選択
レスポンス編集: 生成後の編集・適用機能
ファイル保存: レスポンスのMarkdownファイル出力
Turbo-Quant処理: レスポンスのベクトル量子化による変換(Turboモード)

技術スタック

Frontend

Backend

Turbo-Quant

クイックスタート

前提条件

起動

# non-Turbo起動(http://localhost:3000)
./ready.sh

# Turbo起動(http://localhost:3001)
./ready.sh turbo

詳細ドキュメント

詳細な使い方は USAGE.md を参照してください。

ライセンス

MIT

リポジトリを見る →

watanabe3tipapa/ollama-turbo-quant-pe