入力する代わりに、ダッシュボードに話しかける。
すべてのテキスト欄にマイクがあります。harnsy は、あなたが選んだ認識サービスに音声を送り、テキストをカーソルの位置に入れます。あなたが編集してから、送信します。
よさそうです。1点だけ:
Ctrl+Shift+Space 開始 / 停止 · Esc 取り消し
話す
いま入力している欄に、マイク。
カーソルのあるテキスト欄の隅に、マイクが表示されます。クリックするか、Ctrl+Shift+Space を押します(Mac では ⌘+Shift+Space も使えます)。
録音して、認識する。
録音中は、レベルメーターとタイマーが表示されます。もう一度押すと認識が始まり、Esc で取り消せます。
テキストは、カーソルの位置に。
認識されたテキストは、カーソルのある位置に入ります。自動では送信されず、あなたが編集して、自分で送信します。
何をすればいいか教えてくれるメッセージ。
マイクがない、マイクにアクセスできない、まだプロバイダーがない、プロバイダーがキーを拒否した、というそれぞれに専用のメッセージがあり、どこで直せばよいかも示されます。
認識サービスを選ぶ
プロバイダーは、あなたが追加する。
harnsy は認識サービスを自前では持ちません。システム › 接続 › 音声入力で、OpenAI かあなた自身の Whisper サーバーを追加します。追加するまでは、入力欄にマイクは表示されません。
OpenAI を、あなたのキーで。
音声はあなたの API キーで OpenAI に送られます。OpenAI は音声1分ごとに課金します。
あなた自身の Whisper。
OpenAI 互換 API を持つ Whisper サーバー(たとえば Speaches)を、このマシンまたはあなたのネットワークに置けます。音声はそこにとどまります。
言語は、プロバイダーごとに。
認識する言語を選びます。「自動」ならプロバイダーが判定し、言語を固定することもできます。短いフレーズでは、言語を固定したほうが確実です。
複数のプロバイダーと、1つの既定。
複数追加して、1つを既定にできます。マイクが使うのは、既定のプロバイダーです。
音声の行き先
キーは、このマシンに残る。
API キーはこのマシンに残り、音声は保存されません。認識している間だけ、メモリ上に保持されます。
ブラウザのマイクのルール。
ブラウザがページにマイクの使用を許可するのは、https の場合か、このマシン(127.0.0.1、localhost)の場合だけです。音声入力を使うには、そのようにしてダッシュボードを開いてください。
よさそうです。1点だけ: 再試行のメッセージには、リンクの有効期限を書いてください。
Ctrl+Shift+Space 開始 / 停止 · Esc 取り消し
ダッシュボードのどのテキスト欄にも話しかけられます。今いる欄の隅にマイクが現れます。harnsy は音声を下のプロバイダーに送り、テキストをカーソルの位置に入れます。送信する前に修正できます。キーはこのマシンに残り、音声は保存されません。
- OpenAI既定動作中認識言語自動
- Whisper動作中認識言語ロシア語既定にする
自動:プロバイダーが判定します。短い文では言語を固定したほうが確実です。
できないことも、正直に
- 録音は5分で自動的に止まり、そのあと認識されます。プロバイダー側に、独自の制限があることもあります。
- プロバイダーが必要です。あなたの API キーで使う OpenAI か、あなた自身の Whisper サーバーです。
- OpenAI を使うと、音声はこのマシンから OpenAI に送られます。あなた自身の Whisper なら、そのサーバーのある場所にとどまります。
- ブラウザが音声を録音できて、マイクの使用を許可している必要があります。
最初のチームは、ひと言で始められます。
インストールはエージェントへのひと言で済みます。エージェントを代わりに開くため、harnsy は端末を操作します。Linux と macOS では tmux、Windows では独自の端末ホストです。
https://harnsy.dev/llms.txt の手順に従って harnsy をインストールして