headroomでトークンを削減した話

こんにちは、ナナオです。 突然ですが、AIコーディングエージェントのトークン消費って本当に気になりますよね。 普段は Claude CodeとOpenCode Goを併用しているんですが、両方とも長時間セッションを回しているとあっという間にトークン消費が伸びていきます。 「これ、無駄な部分削れないかな」と思って調べたら headroom を見つけたので、試しに入れてみました。 ※この記事の作成にはMiniMax-M3を大いに活用しています。 headroomとは GitHub - headroomlabs-ai/headroom: Compress tool outputs, logs, files, and RAG chunks before they reach the LLM. 20% fewer tokens for coding agents, 60-95% fewer tokens for JSON, same answers. Library, proxy, MCP server. · GitHub Introduction | Headroom headroom は、AIエージェントが読み取るコンテキスト(ツール出力、ログ、RAG 結果、ファイル、会話履歴)を LLM に渡す前に圧縮するレイヤーです。 公式の説明では「the context compression layer for AI agents」と書いてあって、Python実装のコアに Rust 製トランスフォーマーを組み合わせた構成になっています。 2026年7月時点で57k starがついており、わりと有名なんじゃないかと思います。 インストールとプロキシ起動 Docker イメージをそのまま使います。 docker pull ghcr.io/chopratejas/headroom:latest docker run -d --name headroom -p 8787:8787 \ ghcr.io/chopratejas/headroom:latest これで 8787 番ポートにプロキシが立ちます。コンテナ内で headroom proxy が立ち上がっている状態です。 ...

2026年7月9日 · にあえん

OpenCode + Ollamaで、Tool callがうまくいくモデルを模索している

こんにちは、ナナオです。 突然ですが、ローカルLLM使っていますか? 私は使いたいのですが、デスクトップもメモリもよわよわすぎて、なかなか使うのに奮闘しています。 今回は私が使ってきたモデルの一覧を紹介しようと思います。 使っているPCのスペックは以下の通り。 CPU: AMD Ryzen 9 3900 メモリ: 24GB GPU: GeForce GTX 1660 SUPER 使ったプロンプトは、opencodeの/initコマンドを実行した際の以下の一文(一部改変しています) Please analyze this codebase and create an AGENTS.md file containing: 1. Build/lint/test commands - especially for running a single test 2. Code style guidelines including imports, formatting, types, naming conventions, error handling, etc. The file you create will be given to agentic coding agents (such as yourself) that operate in this repository. Make it about 150 lines long. If there are Cursor rules (in .cursor/rules/ or .cursorrules) or Copilot rules (in .github/copilot-instructions.md), make sure to include them. If there's already an AGENTS.md, improve it if it's located in <プロジェクトディレクトリ> Pythonプロジェクト上で/initコマンドを実行し、プロジェクトディレクトリを読んでそれに合ったAGENTS.mdを出力するか検証しています。 ...

2026年1月25日 · にあえん

ollama + gemma3 + opencodeで最高のコーディング環境を手に入れる

前回の記事からの続きになります。 あれからGLM-4.7やMiniMax M2.1といった無料のモデルを使ってみたのですが、いまいちしっくりくる実装が出力されないことがよくありました。 ただ、Gemini 3 Flashといったモデルはすぐにトークンを使い切ってしまうため、びくびくしながらプロンプトを打っています。 そんなのは嫌だ!!!! ということで今回はollamaを使って今度こそ最高のコーディング環境を作りたいと思います。 ollamaのインストール ollamaのインストールからやっていきます。 WSLの環境に入れるので、以下のlinuxへのインストールを試します。 Linux - Ollama 以下のインストールスクリプトを実行します。 curl -fsSL https://ollama.com/install.sh | sh ちなみに最初miseからインストールを試みたのですが、こちらは失敗しました。 ❯ mise use -g ollama mise ollama@0.14.2 ⠁ 0smise ERROR Failed to install aqua:ollama/ollama@latest: no asset found: ollama-linux-amd64.tgz Available assets: ollama-darwin.tgz Ollama-darwin.zip ollama-linux-amd64-rocm.tar.zst ollama-linux-amd64.tar.zst ollama-linux-arm64-jetpack5.tar.zst ollama-linux-arm64-jetpack6.tar.zst ollama-linux-arm64.tar.zst ollama-windows-amd64-rocm.zip ollama-windows-amd64.zip ollama-windows-arm64.zip Ollama.dmg OllamaSetup.exe sha256sum.txt mise ERROR Run with --verbose or MISE_VERBOSE=1 for more information ということでmiseの公式リポジトリに質問として投げています。 Failed to install ollama · jdx/mise · Discussion #7758 · GitHub ...

2026年1月21日 · にあえん

OpenCode + Gemini(とGLM-4.7)を使って無料で最強のコーディングエージェントを手に入れる

こんにちは、ナナオです。 前回Gemini CLIをセットアップしましたが、今回はOpenCodeとGeminiを組み合わせて最強のコーディング環境を手に入れようと思います。 初期設定 まずはOpenCodeをインストールします。 miseでインストール可能です。 mise use -g opencode 使用するプロバイダを選択します。 Geminiを使いたいので、Googleを選択します。 ❯ opencode auth login ┌ Add credential │ ◆ Select provider │ Search: │ ○ OpenCode Zen │ ○ Anthropic │ ○ GitHub Copilot │ ○ OpenAI │ ● Google │ ○ OpenRouter │ ○ Vercel AI Gateway │ ... │ ↑/↓ to select • Enter: confirm • Type: to search └ APIキーを入力して完了です。 ❯ opencode auth login ┌ Add credential │ ◇ Select provider │ Google │ ◇ Enter your API key │ ▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪▪ │ └ Done opencode auth listで追加したプロバイダにGoogleがいることを確認します。 ...

2026年1月20日 · にあえん