完成版:1台のウェブカメラで、体・顔・指・手首 — アバタートーク
アバタートークの集大成:体・顔・指・手首が、1台のウェブカメラで1つのVRMを、すべてブラウザ上で動かします。なぜ腕の計算では手首を回せないのか、間違った軸で曲がっていた親指、フレームの再利用と取りこぼしの計数、0.3を新しいゼロにするニュートラルな顔、鏡の原則——そして正直な約9fps(言っていた30ではなく)。
アバタートークの集大成:体・顔・指・手首が、1台のウェブカメラで1つのVRMを、すべてブラウザ上で動かします。なぜ腕の計算では手首を回せないのか、間違った軸で曲がっていた親指、フレームの再利用と取りこぼしの計数、0.3を新しいゼロにするニュートラルな顔、鏡の原則——そして正直な約9fps(言っていた30ではなく)。
アバタートークの完結編:体・顔・手が1つのVRMを、ブラウザの単一レンダーループで動かします。遅延と揺れの二律背反を破る One Euro フィルター、ランドマークを「源」で平滑化、MediaPipeの52 ARKitブレンドシェイプをVRMの表情へ、そして指の「開閉(bend)だけ」を取るハンドトラッキング。
作り方は同じ——姿勢を検出し、追跡し、分類する——でも根拠はまるで違う。2026年の一方は理学療法の運動を専門家の正解データと照合して採点し(RTMPose + GRU、約96%)、もう一方は正解ラベルなしでバスケの動きをプロファイリングし、それを自ら明言する。パイプラインを検証するのは検出器ではなく正解データです。
動きは計測できた。でも終わりではありません。2026年7月の2本の論文が、検証済みの運動学からモデル化された傷害リスクの数値までをたどります。OpenCapマーカーレスのスコーピングレビュー(51件)と、バドミントンのランジからACL負荷を推定するモデル(OpenSim+XGBoost、R²約0.91)。推論の層ごとに不確実性は積み重なります。
アバタートーク #3:MediaPipeの姿勢ランドマークをVRMアバターのボーン回転へリターゲティングします。位置と回転の違い、MediaPipe→VRMの座標反転と鏡映し、基準→目標のクォータニオン、ワールド→ローカルのチェーン、フレームレート非依存のイージング、そしてカメラ1台の深度補正まで。
アバタートーク #2:本物の3D VRMアバターを、three.js と @pixiv/three-vrm でブラウザに読み込みます。VRMの標準ボーンマップがなぜ重要か、15MBモデルで効く後処理、2行で足す呼吸、そしてリップシンク用の表情システムまで。
インストールもサーバーも不要。ブラウザだけで動くリアルタイムのモーションキャプチャを約200行のTypeScriptで作ります。アバタートーク #1:ウェブカメラ、透明キャンバス、MediaPipeのPoseLandmarkerで上半身スケルトンをライブ描画。実際に動かす2つの落とし穴も解説。
2026年の論文2本は正反対の賭けをしています。SoccerNet は427チーム・1,129件を1つの共有ベンチマークに集約し、スケートボード研究は1つの商用IMUを研究室の基準と照合して、入り混じった結果を得ました。
レビュー2本と研究1本が示すのは、AI×ウェアラブルによる傷害予測の「展望」と「実証」の距離です。今日あるのは専門家の判断を再現する良い分類器(AUC 0.86)であり、将来の傷害を予測する検証済みの手段ではありません。
カメラは安くなりました。2026年の3本——3次元再構成パイプライン、系統的レビュー、スマホ1台——はいずれも同じ方向を示します。全体的で粗い指標には手が届き、細かい時間分解能と関節角度にはどの価格帯でも届かない。