第601回:中小企業のAI導入、成功事例はどう使う?改善率をそのまま自社に当てはめない理由
Episode Ep 600

第601回:中小企業のAI導入、成功事例はどう使う?改善率をそのまま自社に当てはめない理由

From Webコンサルタント中山陽平の「中小企業を強くするWebマーケティングラジオ」 ラウンドナップ・Webコンサルティング 代表 中山陽平

Podcastを今すぐここで聞く

ラウンドナップWebコンサルティングの中山陽平です。今回は、AI(Artificial Intelligence:人工知能)導入の成功事例や調査を、自分たちの会社でどう使えばよいかという話です。結論から言うと、成功事例は、自社で試していくための出発点だと考えていただきたいと思います。

AIの導入が進んだといっても、文字起こしなどの用途にとどまる会社もあれば、全社で使う会社もあり、温度差があります。その中で「生産性が何パーセント上がった」というニュースを見ると、同じことをすれば自分たちも成果を得られるのでは、と思いますよね。失敗を避けたいから、先に成功事例を知りたくなる。ニュースや事例ページも、そう感じる構成になっていると思います。

ただ、今回は「成功事例を疑え」という話ではありません。調査や事例を参考にしながら、うちではどうするかを考えて動く。その必要性を、研究の結果と、私が現場で見てきた違いからお話しします。

成功事例の「試行錯誤」を読み飛ばさない

私もすべての事例を見ているわけではありませんが、多くの場合、書かれていないところで思いどおりにいかないことを乗り越えています。失敗せずに成功したのではなく、うまくいかないことを直した結果、成果が出ているんですね。

ところが、事例では「試行錯誤を経て」「フィードバックをもとに」と、さらっと書かれます。読む側には、すんなり進んだように見えてしまう。自分たちで試して、最初に失敗すると、「うまくいかないじゃないか。これは違う。別の方法を探そう」となる。その段階でやめてしまうのは、とてももったいないと思っています。

AIを受け入れる素養や状況、業種、仕事の内容は、現場ごとに違います。巷にある情報を読んだだけで、そのまま当てはまると思わない方がいい。自社に合わない部分を、現場に合わせて直す仕事が残るわけです。

AIの改善率は、誰が何をした数字なのかを確かめる

きっかけになったのが、METR(Model Evaluation & Threat Research)という非営利研究機関の研究です。先端的なAIの能力やリスクを評価している機関で、2025年前半の実験が一部で話題になりました。経験豊富なオープンソース開発者に、普段の仕事を「AIを使ってよい」「使ってはいけない」という条件でランダムに割り当てると、AIを使える方が、平均で19%長くかかったという結果だったんです。

参照:METR:2025年前半の開発者の生産性研究

業務を効率化できるはずなのに、どうして時間がかかるのか、と感じますよね。もちろん、どの業務を対象にして、どこまでを測るかによって、結果の捉え方は変わります。私が仕事の現場でも気になるのは、目の前の作業が短くなっても、付随する仕事まで含めるとうまくいかないことがあるという点です。

次の研究で短縮しても、単純な比較はできない

METRが2025年後半に始めた研究では、今度は時間が短くなる方向の結果が出ました。収録では「18%ぐらい短縮」と紹介しています。単純に読めば、AIの使い方に慣れてきたのかな、と思いますよね。ところがMETR自身は、この数値を、その時点のAIによる生産性向上の実態として使うのは難しいと説明しています。

編集注:「18%短縮」は、前回から続けて参加した開発者の推定値です。新規参加者では4%短縮の推定で、いずれも信頼区間は時間が延びる場合を含みます。2026年2月24日の報告は、選択の偏りが大きく、改善幅を示す証拠としては弱いとしています。原文中の参加規模も記憶が曖昧でしたが、報告上は57人、143リポジトリです。

参照:METR:開発者の生産性を測る実験設計の見直し

調査へ参加する人と、提出する仕事が変わる

人が関わる調査では、参加するかどうかの段階で偏りが生じます。普段AIを使って仕事をしている人に、「半分はAIなしでやってください」と頼んだら、参加したくない人もいるでしょう。AIの効果を強く感じている人ほど、調査から抜けてしまう可能性があるわけです。

報酬も参加するかどうかに関わります。普段ならAIですぐ済む仕事を、使わずに長い時間かけてやる。その負担に見合うと思えなければ、わざわざ参加しません。報酬や条件が変われば、参加してくる人の属性も変わります。

編集注:原文では報酬を「500ドルぐらい」「100ドルとか50ドルかな」と曖昧に挙げ、後半では日当のように比較しています。公式報告では、初回は時給150ドル、後の研究は時給50ドルです。日当との比較は成立しないため採用せず、報酬条件が参加者の選択に影響し得るという論点を残しています。

参照:METR:報酬変更と参加者の選択について

仕事の選び方にも偏りが生じます。「これがAIなしに割り当てられたら困る」という仕事を、最初から実験に出さない人もいた。AIを使わないと10倍ぐらい時間がかかるなら、出したくなくなりますよね。参加者だけでなく、測られる仕事も選ばれているんです。

参照:METR:タスクを提出しない選択について

ここをきちんと説明して、結果を広く当てはめられるとは言わないのは、誠実だと感じます。私が皆さんにお伝えしたいのも、調査を信頼するなということではありません。参考にすることと、そのとおりに進めれば失敗しないと考えることは、分けてほしいんですね。

他社の30%改善を、自社の15%改善へ置き換えない

仮に「AI導入で30%効率化しました」という事例があったとします。これはMETRの数値ではなく、私が説明のために出す例です。すると、「うちは30%までは無理でも、15%、20%ぐらいはいけるのでは」と思いがちです。でも、他社の成果を少し割り引けば、自社の成果になるわけではありません。

関わる人、権限、仕事の内容、意思決定の仕組み、トップの考え方が違います。タイミングや運もあります。使えそうな要素を取り入れるのはよいのですが、社内に根づかせ、受け入れてもらう方法は、その現場で判断するしかないんです。

同じような会社でも、使われる仕組みと使われない仕組みがある

同じ業種で、規模も同じぐらい。私が両方の社長さんを知っていても、浸透の仕方がまったく違うことがあります。業種や規模が似ていることだけでは、導入の進み方は分かりません。

例えば、それまで顧客管理をしておらず、新しいツールを入れることには抵抗がある。でも、皆さん普段Gmailを使っている。それならGoogle Workspaceを入れて、Google Apps Scriptで簡単な顧客管理の仕組みを作りましょうか、と提案します。3か月ぐらいで使えるようになる場合もあれば、作ったのに全然使われない場合もあるんですね。

その違いは千差万別です。私は「こうすれば必ずうまくいく」とは言えませんし、決まった方法を示されても、そのまま受け取ってよいのかは考えてほしい。ゴールへ向けて、自分たちの会社では何を変えるかを、その都度考える必要があります。

ツール選びで止まる時間を、自社で試す時間に変える

Gemini、ChatGPTやCodex、Claudeなど、どのAIを使うかもよく議論になります。「どれがいいですか」と聞かれますが、実際に使わなければ、自社に合うかは分からないと思います。

Google製品との連携が合う場合もあります。お客さんがGoogle Workspaceを使っていれば、Google Apps Scriptで組んだものを大きくするときに、Googleのクラウドへつなぐこともあります。一方、ChatGPTで使うプロンプトが社内にたまっていれば、別のベンダーを介したり、Cloudflareを使ったりすることもある。今まで使ってきたものや、社内にある知識によって選び方は変わります。

どれが一番費用対効果に優れているかを考えて、立ち止まっているなら、その時間はすごくもったいない。複数使ってみて、月に1回か2回でも、どれがよかったかを話す勉強会を開く方が、はるかにいいと思います。自社で使って、知見をためるものだと考えてください。

AIの力を、車のトルクや馬力と同じように比べると失敗します。私たちは、AIの力をすべて引き出せるわけではありません。自分たちが、その力をどれだけ引き出せるかという観点で見る必要があります。

有料版を前提に、使いやすいものから試す

企業では、基本的に有料版を使うべきだと私は考えています。最初から一つの正解を探しすぎず、使いやすいものを試す。ChatGPTやCodex、Google系ならGemini、Claude Codeも使ってみて合うなら使えばよいと思います。まず使い、自社で判断できる材料を増やすことです。

強いて言えば、私は収録時点では、ローカルLLM(Large Language Model:大規模言語モデル)で何とかしようというのは、趣味の範囲だと考えています。高いパソコンを用意しても、各社がサービスとして提供するものとは性能が大きく違う。企業が基本的にローカルLLMを選ぶという選択肢はない、というのが現時点での私の考えです。

本人の時短だけでなく、周囲に増える仕事を見る

「毎月30時間かかっていた集計が、AIで30分になりました」というような話があります。本人は満足しますよね。ただ、その人の目の前の作業だけで、会社の仕事が完結しているわけではありません。一人の作業時間が減ったことと、会社全体の仕事がよくなったことは別です。

AIを入れることで、再チェックが必要になる場合もあります。AIも間違えますからね。何度も使ってテンプレート化し、ずれを減らしていくとしても、その途中で周りは「なんとなく作業が増えた」と感じるかもしれません。確認にかかる手間や、周囲のストレスまで含めて見る必要があります。

AIに慣れていない人には、「ずるをしているんじゃないか」と見えることもあります。一昔前、Excelを使う人に向けられた反応のようなものです。そうした気持ちも考えないと、AIを使う人と使わない人の間で、社内に分断が起きてしまうんですね。

平均で何パーセント改善したかも、人によります。新人に効くもの、熟練者に効くもの、現場によって合うものがある。そこを飛ばして、生産性の改善率を一律に人事評価へ反映するところまで進めると、だいたい失敗します。

空いた50分を、何に使っているかまで確かめる

DeNAの南場さんのお話も、ここにつながると思います。仕事の時間を短くしても、普段やらないことまでAIで行い、本来取り組みたかった新規事業へ人や時間が回らなければ、目的を達成したとは言えません。時短の先に、会社として何をしたかったのかを見る必要があるんですね。

参照:DeNA:南場智子「先に動かし、事業を広げる」講演書き起こし

例えば、60分かかっていた分析のためのデータ集計が、10分で終わるようになったとします。残りの50分で、その人にしかできない価値のある仕事をしているならよいでしょう。でも、空いた50分を、さらに分析を深掘りするために使ってしまうこともあります。

私もやりがちです。集計がさっと終わると、「もっと知りたかったことを調べられるじゃないか」と、データを追いたくなる。でも、やってみたらあまり関係なかったり、現場を動かす材料にならなかったりするんですよ。本人が面白い分析をしたことと、成果につながったことは同じではありません。

「AIでダッシュボードを作りました」と見せてもらい、アクセス解析を入れたら、初日に10人ぐらいが見て、その後は一度も見られていない。そういうこともありますよね。作れたかどうかだけでなく、その後に使われているかまで見たいところです。

DeNAは、約3,000人で行っている事業を半分の人員で発展させ、残りは新規事業へ、という考えを示していました。あのように外へ発信するのも、社内で多くの知見を得たからではないかと私は思います。ただ、中の方とのつながりがあまりないので、今どうなっているかは分かりません。社内の実態を知って話しているわけではないという点は付け加えておきます。

参照:

Community discussion

No posts yet

Be the first to start the conversation about 第601回:中小企業のAI導入、成功事例はどう使う?改善率をそのまま自社に当てはめない理由