このガイドでは、Claude Opus 5 の1M tokenコンテキストを実案件で活かす方法を5つの具体的ステップに分けて解説します。大規模LLMを効率的に運用するための基本パターンが理解できます。
対象読者
- Claude APIを使用している開発者
- 大規模プロンプト(API仕様書+コード+ログなど)を処理したい人
- 長時間の推論タスク(多ステップ問題解決、ドキュメント分析)を実行したい人
- Opus 4.8からの移行を検討している人
確認環境
- Claude Opus 5(モデルID: claude-opus-5)
- Claude API 確認日:2026年09月18日
- 公式ドキュメント版:July 24, 2026 release
背景:なぜOpus 5なのか
Opus 5は2026年7月に正式リリースされた最新世代のエンタープライズAIモデルです。前世代のOpus 4.8との最大の違いは1M tokenのコンテキストがデフォルト標準化されたこと。従来は200K contextが標準で、大規模処理には別途リクエストが必要でした。Opus 5では、複雑な推論タスクと長いコンテキストが同梱されているため、ドキュメント分析やコード解析のような「大量の参照資料」が必要な業務に一気に対応できます。
何が便利なのか
1つのリクエストで処理可能な規模が飛躍的に拡大
| 処理内容 | Token数 | 従来(200K) | Opus 5(1M) |
| API仕様書 | 5万 | ○ | ○ |
| コードベース | 20万 | ✕ | ○ |
| エラーログ | 10万 | ○ | ○ |
| 設計ドキュメント | 15万 | ✕ | ○ |
| 合計 | 50万 | 15万/200K超過 | 50万/1M利用可 |
この5倍のコンテキスト活用で、プロンプトエンジニアリングの工夫が減り、シンプルな指示でも精度が上がります。
必要なもの
- Claude APIのアカウント(Pro/Max/Enterpriseプラン、または直接API利用)
- モデルIDを claude-opus-5 に指定できるSDK/クライアント
- 対応言語:Python、Node.js、Java、Go、C#ほか(各言語用公式SDK)
価格を理解する
実装に進む前に、コスト構造を把握するのが重要です。
基本料金(キャッシュなし)
- 入力:$5 / 100万token
- 出力:$25 / 100万token
Prompt Cachingを使った場合(2回目以降)
- キャッシュ書込(5分間):$6.25 / 100万token
- キャッシュ読取:$0.50 / 100万token(通常の90%削減)
同じドキュメント群を複数回処理する場合、Prompt Cachingで10倍のコスト削減が可能です。
Step 1: 実行環境をセットアップする
前提:Python 3.9以上とAnthropicの公式SDK
pip install anthropicAPIキーの設定
export ANTHROPIC_API_KEY=your-api-key-hereStep 2: 最初のリクエストを送る(200K の時代との違いを確認)
from anthropic import Anthropic
client = Anthropic()
# Opus 4.8では200Kが標準
# Opus 5では1Mがデフォルト
with open("large_document.txt", "r") as f:
document_content = f.read()
response = client.messages.create(
model="claude-opus-5",
max_tokens=2048,
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": f"このドキュメントを分析してください:\n\n{document_content}"
}
]
}
]
)
print(f"入力: {response.usage.input_tokens} tokens")
print(f"出力: {response.usage.output_tokens} tokens")
print(f"応答: {response.content[0].text[:200]}...")従来の200K contextモデルなら「入力超過エラー」で終わります。Opus 5なら処理完了。
Step 3: 思考(Thinking)の制御
Opus 5の大きな変化:思考がデフォルトで有効
# Opus 4.8の慣例でthinkingを無効化したい場合
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
thinking={
"type": "enabled",
"budget_tokens": 2048 # 思考に使う最大token数
},
messages=[{"role": "user", "content": "複雑な問題です..."}]
)
# thinking を完全に無効化したい場合
# 注意:effort ≤ high のときのみ可能
response = client.messages.create(
model="claude-opus-5",
max_tokens=2048,
effort="high", # effortを明示的に指定
messages=[{"role": "user", "content": "シンプルな質問です"}]
)選択肢:adaptive(推奨)は難度に応じて思考量を自動調整、enabled は思考を有効で予算を指定、disabled は思考を無効化(effort ≤ high のとき)
Step 4: Prompt Caching で反復処理を高速化
大規模ドキュメント(仕様書など)を何度も参照する場合:
# 初回:キャッシュに書込(少し高い)
with open("api_spec.md", "r") as f:
spec = f.read()
response = client.messages.create(
model="claude-opus-5",
max_tokens=2048,
system=[
{
"type": "text",
"text": "あなたはAPIスペシャリストです。提供されたドキュメントに基づいて回答してください。"
},
{
"type": "text",
"text": f"## API仕様書\n{spec}",
"cache_control": {"type": "ephemeral"} # 5分間キャッシュ
}
],
messages=[
{"role": "user", "content": "このAPIでユーザー認証を実装する方法は?"}
]
)
print(f"キャッシュ作成: {response.usage.cache_creation_input_tokens} tokens")
print(f"実入力: {response.usage.input_tokens} tokens")2回目以降のリクエスト(同じシステムプロンプト使用)ではキャッシュから読取(90%削減)
Step 5: ツール使用との組み合わせ(実務パターン)
実装中のエラーを分析する実装例:
import json
tools = [
{
"name": "run_test",
"description": "テストを実行して結果を取得",
"input_schema": {
"type": "object",
"properties": {
"test_file": {"type": "string", "description": "テストファイルパス"},
"test_name": {"type": "string", "description": "テスト名"}
},
"required": ["test_file"]
}
},
{
"name": "get_logs",
"description": "エラーログを取得",
"input_schema": {
"type": "object",
"properties": {
"log_level": {"type": "string", "enum": ["ERROR", "WARN", "INFO"]}
}
}
}
]よくあるエラーと対処法
エラー1: 「入力トークンが多すぎます」
原因:1Mを超える入力。不要なドキュメント部分を削除するか、複数リクエストに分割。
# トークンを数える(事前チェック)
response = client.messages.count_tokens(
model="claude-opus-5",
messages=[{"role": "user", "content": large_prompt}]
)
print(f"推定トークン数: {response.input_tokens}")
if response.input_tokens > 950000: # 安全マージン
print("プロンプトが大きすぎます")エラー2: 「思考ブロックが無効です」
原因:ツール使用時に思考ブロックを改変した。対策:思考ブロック(thinking タイプ)は一字一句変更せずに返す。
エラー3: 「effortが高くなければthinkingは無効化できません」
原因:effort: xhigh で思考無効化を試みた。xhigh では思考は必ず有効。
注意点と限界
- コンテキストロット:大量のテキストが入力されると、モデルの精度が低下。対策:最も重要な情報を前に配置。
- キャッシュの最小サイズ:Prompt Cachingを使うには、キャッシュ対象が最低512トークン必要。
- 思考トークンの消費:適応的思考はmax_tokensの一部を使う。実際の応答は予想より少ない可能性も。
- 画像・PDFの上限:600ファイルまで(200Kモデルは100)。
まとめ
Opus 5 の1Mコンテキストは、5つのポイントを覚えれば活用できます:
- API + コード + ログ を1つのリクエストで処理
- Prompt Cachingで大規模参考資料をキャッシュして高速化
- 思考を活用して複雑な推論タスクに対応
- ツール呼び出しで実行結果を取り込みながら改善
- コスト管理は事前のトークンカウント + キャッシュ戦略で
この5つを覚えれば、Opus 4.8では実装不可能だった大規模処理が現実的になります。
