結論から:AIサイネージは「映像を流す」ためではなく「会話する」ために作られたディスプレイで、違いはソフトではなくハードにあります。目の前に立った人をきちんと捉えられるカメラ、周囲に音がある場所でもその人の声を拾えるマイクアレイ、立っている人に向いたスピーカー、そして本体に入った本物のコンピューター(メディアプレーヤーではなく)。どんな画面でもAIソフトを「動かす」ことはできます。メーカーに聞くべきは「AI対応ですか」ではなく「数値はいくつですか」です。以下、聞くべき数値をまとめました。
ふつうのサイネージでは、なぜできないのか
一般的なデジタルサイネージは一方向の機器です。パネルがあり、動画を再生して配信クライアントを動かす小さなメディアプレーヤーがあり、目の前に人がいるかどうかを知る手段はありません。広告用の画面としてはそれで正しい設計です。コンテンツを配信し、画面が再生する。応答は誰も期待していません。
会話するディスプレイはその前提をすべてひっくり返します。人が近づいたことを検知し、認識できる品質で声を取り込み、AIモデルを動かすか呼び出し、公共空間に立っている人が聞き取れる形で返す。各ステップにハード側の要件があり、メディアプレーヤーはそのどれも満たしません。既存の画面にUSBカメラと会議用マイクを足せばデモにはなりますが、実運用できる製品にはなりません。カメラの高さが合わず、マイクはフロア全体を拾い、音は壁に向かって鳴るパネルスピーカーから出ます。
成否を決める4つの数値
再生用の画面なら、重要なのはパネルのスペックです。会話するディスプレイで重要なのは、人が実際に「見えて」「聞こえる」空間の広がりです。これを対話範囲(インタラクション・エンベロープ)と呼びます。パネルもCPUもカメラ画素数も同じ2台が、次の4つの数値次第でまったく違う振る舞いをします。そして多くのカタログは、この4つをどれも公開していません。
| カメラ画角 | 検知できる円錐の広さ。狭いレンズだと、ほぼ正面に立たないと認識されません。 |
| カメラ高さと下向き角度 | 誰の顔が画面内に入るかを決めます。1,700 mmで水平のままだと、座っている人や子どもの頭上を見てしまいます。 |
| マイク収音角度 | 正面からどれだけ外れて立っても声を拾えるか。 |
| マイク収音距離 | これは明確な限界値です。これを超えると、背後のモデルがどれだけ優秀でも認識率は一気に落ちます。 |
参考値として、EKAAは75インチAI対話型ディスプレイについて次の数値を公開しています。カメラ画角78°、下向き15°、カメラ高さ 床から1,700 mm、マイク水平収音角度60°、収音距離1.5 m。これは「腕を伸ばした少し先に立つ一人の人」と向き合う対話ステーションであって、ロビーの向こう側から話しかけられる遠距離型ではない、ということを示しています。
ここが実際の計画上の制約になります。対話範囲が分かれば、スペックを上げるよりフロアのレイアウトのほうが効きます。動線、床のサイン、あるいは単に「人がもともと足を止める場所」に置くこと。それだけで、カメラを良くするより実用的な対話数は増えます。
メーカーへの質問:「カメラの画角・設置高さ・下向き角度と、マイクの収音角度・収音距離を教えてください」。これに答えられない相手は、対話機器を作っているのではなく画面を転売しています。
マイクは「1本」ではなく「アレイ」
公共空間でマイク1本は、すべてを等しく拾います。来場者の声も、空調も、エスカレーターも、2 m後ろの雑談も。複数素子のアレイであれば、正面の人に指向性を向けて残りを抑えられます。これが「昼のピーク時でも使える音声認識」と「建物が空いているときだけ使える音声認識」の差です。
素子数と、ビームフォーミング・ノイズリダクションが本体側で動くかを確認してください。そのうえで、もう一歩踏み込んだ質問を。どの騒音レベルで測定した性能値ですか。静かなショールームのデモは、17時半の駅コンコースについて何も教えてくれません。
AndroidかWindowsか ― 好みの問題ではない
これを決めるのはAIアプリケーションであって、購入側の好みではありません。レンダリングエンジンを使うデジタルヒューマン、Windows専用のキオスクアプリ、特定のランタイムを要求するビジョンモデルであればWindowsになります。クラウドAPIを呼ぶ軽量な対話アシスタントや、すでにAndroidタブレット向けに作られたアプリなら、Androidで十分に動き、コストも下がります。
重要なのは、発注前にその選択肢があるかです。Androidボードが基板に直付けされた機種は、後からWindowsアプリをホストできません。設置後にコンピューティングモジュールだけ載せ替えるのは、多くのハードで現場作業にはなりません。アプリを先に決め、それからコンピューターを指定してください。
メーカーへの質問:「コンピューティングモジュールは案件ごとに指定できますか。中身は何ですか」
クラウドかオフラインか ― コンテンツ設計の前に決める
対話アプリの多くはネットワーク越しにモデルを呼びます。つまりネットワーク品質は実質的にハード要件であり、しかもたいてい手遅れになってから発覚します。
- 有線:予測可能で、常設なら実質これ一択。設置位置に情報コンセントが必要で、竣工済みの建物では IT 工事ではなく建築工事になります。
- 施設のWi-Fi:施設が混むまでは動きます。そして混んでいるときこそ、その機器が使われます。ピーク時に実測してから決めてください。
- モバイル回線:商業施設の自立設置なら問題ありませんが、地下や鉄骨造では不確実です。入口ではなく、実際の設置位置で測ってください。
- オフライン動作:ローカルでモデルを動かすなら本体内のコンピューターは一段上が必要で、仕様も価格も変わります。安定した回線が用意できない現場なら、納品後ではなく見積段階で伝えてください。
早めに決めるべき理由はもう一つあります。コンテンツ設計が変わるからです。回線が落ちうる機器には、スピナーではなく「上位10問にはタッチだけで答えられる状態」という、まともなオフライン時の挙動が必要です。
音声はデモで見るより頻繁に失敗する
音声操作は決まったパターンで失敗します。騒音下。聞き慣れないアクセント。公共の場で声を出したくない人。そして、名前・番号・住所がからむとき。ホテルのロビーで部屋番号を声に出したくない宿泊客はいますし、店頭で「それを聞いているところ」を周囲に聞かれたくない客もいます。
ですからタッチは予備機能ではなく、製品の半分です。音声で答えられることは、すべてタッチでも到達できるようにしてください。タッチ面も不特定多数向けの仕様が要ります。投影型静電容量、10点マルチタッチ、そしてアンチグレア処理。設置初日の1時間で付く指紋が画面を台無しにしないためです。オプティカルボンディングもここで効きます。ガラスとパネルの間の空気層をなくすことで、斜めから見ても画像が読め、結露や剥離が黒いシミとして出る故障モードを避けられます。
パネル側の条件 ― 輝度と設置位置
屋内向けAI機は500 cd/m²前後で仕様されるのが一般的で、ロビー、店舗内、通路ならこれで適切です。直射日光が当たる位置やガラス面の正面には足りません。画像が飛ぶだけでなく、会話型の機器としてより重要な問題として、来場者の背後からの強い逆光は顔検知の妨げになります。設置できる位置が窓に面する場所しかないなら、最初から輝度仕様を上げてください。輝度は後から足せません。
解像度は見た目ほど大きな判断ではありません。縦型の大画面に人が近づいて立つ構成なら、1 m以内で文字を読むことになるので4Kの価値があります。それ以外では、画素数よりコンテンツの質のほうが効きます。
投資が回収できる場所、できない場所
効くのは、人が一日中同じ質問を受けている場所です。何か国語かで同じ20問に答え続けるホテル・ビルのコンシェルジュ。最初のひと巡りの質問がいつも同じ店頭や商品棚の前。午前中ずっと製品紹介を繰り返している展示会やショールーム。有人カウンターか行列かの二択になっているクリニック、役所、交通拠点。
効かないのは、遠距離から見る告知用画面、メニューボード、そもそも誰も立ち止まらない位置、そして正直なところ「よくできた掲示」で足りる場所です。AIハードは再生用の画面より高く、会話が実際に発生する場所でしか回収できません。発注前に、想定設置位置で何人が足を止めるか数えてみること。これは安上がりで確実な調査です。
2年目からかかるもの
ハードは一度きりの費用です。2年目からの継続費用は、モデル/API の利用料、回答の裏にあるナレッジベース、そしてそのナレッジベースを最新に保つ担当者です。公開から半年で回答が古くなったコンシェルジュ機は、機器がないより悪い。来場者が「これは当てにならない」と学習してしまうからです。
設置費だけでなく、運用のオーナーを予算化してください。実務上、AIサイネージが3年目にまだ使われているかどうかを最もよく予測するのは、スペックではなく「社内の誰かがその中身を維持する役割を正式に持っていたかどうか」です。
ハード側で聞いておくべきは、どのアセンブリが単体で交換できるかです。パネル、タッチ層、コンピューティングモジュール、カメラ、マイク基板。一体封止の構造だと、どこが壊れても丸ごと引き上げることになります。
発注前チェックリスト
- どのAIアプリを動かすか ― したがって Android か Windows か:______
- クラウドかオフラインか:______ ・設置位置の回線:有線 / Wi-Fi / モバイル / なし
- カメラ画角:______ ・高さ:______ mm ・下向き角度:______°
- マイク素子数:______ ・収音角度:______° ・収音距離:______ m
- 人が立つ位置は対話範囲に収まるか:______
- ピーク時の騒音レベル:______
- 来場者の背後の光:______ ・指定輝度:______ cd/m²
- タッチ:10点PCAP / アンチグレア / オプティカルボンディング:有 / 無
- 対応言語と、初期表示の言語:______
- 画面サイズと向き:______ ・固定か、イベント間で移動するか:______
- 単体交換できるアセンブリ:パネル / タッチ / コンピューター / カメラ / マイク
- 公開後のナレッジベースの担当:______
EKAAの場合
EKAA TECHNOLOGYは商用ディスプレイを自社で設計・製造しており、AI対話ハードも同じ屋内インタラクティブのラインで作っています。機構設計・組立・検査を社内で行っているため、カメラの位置と角度、マイクの配置、コンピューティングモジュール、画面サイズ、筐体仕上げは、既成カタログから選ぶのではなく設置条件に合わせて決められます。本稿の対話範囲の数値も、販促資料ではなく実際に製造しているチームの図面から出ています。オプティカルボンディングは全サイズ標準、構造はモジュール式でアセンブリ単位の交換が可能、標準ラインナップと並行してODM・OEMも承っています。AIラインナップはAIサイネージのページに、本稿で挙げた対話範囲の数値は75インチ AI対話型デジタルサイネージに掲載しています。

English
Español
日本語
Français
Deutsch
Tiếng Việt
العربية
Portugues
lingua italiana