Selfhosting

llama.cppルータモデルをすべてアンロードする

llama.cppルータモデルをすべてアンロードする

llama-serverを停止せずにVRAMを解放する方法

llama.cpp ラーターモード は、llama-server における数年間で最も有用な変更の一つです。これにより、ローカルLLM運用者は、Ollamaで期待されるようなモデル管理体験に近いものをようやく手に入れることができました。同時に、llama-server を使い続ける価値がある生のパフォーマンスと低レベルの制御も維持されています。

QwenおよびGemmaにおけるエージェンティックLLM推論パラメータの参照

QwenおよびGemmaにおけるエージェンティックLLM推論パラメータの参照

エージェント型LLMのチューニングに関する参照資料

このページは、エージェント型LLM推論チューニングの実用的なリファレンス(temperature、top_p、top_k、ペナルティ、およびマルチステップやツール多用なワークフローにおけるそれらの相互作用)です。

より広範なLLMパフォーマンスエンジニアリングハブと併せて参照し、明確なLLMホスティングとサービングの概要と組み合わせることで、モデルがリソース不足に陥った際にはスループットとスケジューリングが依然として支配的ですが、不安定なサンプリングはGPUが処理を終える前にリトライと出力トークンを消費してしまうことがわかります。

このページでは以下をまとめます:

  • ベンダー推奨パラメータ
  • GGUFおよびAPIに組み込まれたデフォルト値
  • 実世界のコミュニティの知見
  • エージェント型ワークフローの最適化

現在、以下に焦点を当てています:

スマートフォンからのヘルメス音声コントロール

スマートフォンからのヘルメス音声コントロール

スマートフォンからHermesと会話する

スマートフォンからテキストでヘルメスエージェントとチャットすることはすでに可能でしょう。 今、あなたはエージェントと直接会話し、音声で返信を受け取りたいと考えています。 これは通常、正しい選択です。特にHermesを永続的な自己ホスト型アシスタントとして使用している場合には顕著です。 小さな画面で長いプロンプトをタイプするのは、時間がかかり、誤りも生じやすいものです。

Hermes エージェントのスキル作成 — SKILL.md の構造とベストプラクティス

Hermes エージェントのスキル作成 — SKILL.md の構造とベストプラクティス

著者:Hermes。高速に読み込まれ、安定して動作するスキル。

Hermes Agentは、繰り返し可能なワークフローを教えるデフォルトの方法としてスキルを採用しています。公式ドキュメントでは、スキルはオープンなagentskills.io仕様に準拠したオンデマンド型ナレッジ文書と説明されており、**プログレッシブ・ディスクロージャー(段階的開示)**によってモデルがまず小さなインデックスを見て、タスクが実際に必要としたときにのみ完全な指示を取得する仕組みになっています。

Agent Memory Provider比較:キャプチャポリシーとセルフホスティング

Agent Memory Provider比較:キャプチャポリシーとセルフホスティング

キャプチャポリシーは、リコールと同等の重要さを帯びつつある。

2026年9月更新: Mnemosyne と Memori を追加、Honcho と Hindsight の設定を拡張し、元のインフラストラクチャテーブルの yanıでキャプチャポリシー比較表を追加しました。

現代のAIアシスタントは、タブを閉じても何も覚えていない状態が続きますが、これはコンテキストウィンドウを超えて何かが永続化されないためです。エージェントメモリプロバイダーとは、セッション間で事実や要約を保持するサービスまたはライブラリです。多くの場合、プラグインとして組み込まれることで、フレームワークをスリムに保ちながらメモリをスケーリングできます。

AIシステムメモリ — 永続知識とエージェントメモリ

AIシステムメモリ — 永続知識とエージェントメモリ

単一のチャットスレッドを超えた永続的なナレッジ。

このセクションでは、AIシステムの永続的な知識と記憶に関するガイドをまとめています。アシスタントが事実、設定、抽出された文脈を、プロンプトにすべてのトークンを詰め込むことなく、セッション間で維持する方法についてです。ここでは、記憶とはGPUのRAMやモデルの重みではなく、意図的な保持(ユーザーに関する事実、要約、プラグインバックエンドのストアなど)を指します。

Hermes Agent メモリシステム:永続的AIメモリの動作原理

Hermes Agent メモリシステム:永続的AIメモリの動作原理

メモリこそが、ツールとパートナーとの違いを創り出す。

AI エージェントとのチャットを開始し、プロジェクトの概要を説明し、好みを共有し、いくつかの作業を行い、タブを閉じる。その翌週にもう一度戻ってくると、まるで見知らぬ人と話しているかのようですね。すべてのコンテキストが失われ、すべての好みは忘れられ、プロジェクトはゼロから再説明しなければなりません。

2026年のナレッジマネジメント:PKMツール、自己ホスト型Wiki、およびデジタルシステム

2026年のナレッジマネジメント:PKMツール、自己ホスト型Wiki、およびデジタルシステム

PKMツール、方法、および自己ホスト型Wikiの比較

パーソナル・ナレッジ・マネジメント(PKM)には、Obsidian、Logseq、DokuWiki、Zettelkasten、PARAといった選択肢がありますが、適切なツールは、ローカル環境でのノートグラフ、セルフホスト型ウィキ、アウトライナー駆動型のワークフローのいずれを優先するかによって異なります。

OpenClawスキルエコシステムと実務向けの推奨スキル

OpenClawスキルエコシステムと実務向けの推奨スキル

保持すべきスキルと、スキップしてよいスキル

OpenClawには2つの拡張ストーリーがあり、それらは混同されやすいものです。

プラグインはランタイムを拡張します。スキルはエージェントの振る舞いを拡張します。