【寄稿】ユーザー中心のビッグデータ活用体制構築戦略
2023. 04. 10

多くの企業が多様化するデータを活用するため、分析プラットフォームを構築しています。データレイクに社内データを集める基盤から始め、多形式の収集と高度な分析で意思決定者へ質の高いインサイトを届けようとしています。
一方、多くの企業・機関は導入済み基盤に懐疑的で、運用にも苦労しています。投資収益、既存情報・分析システムとの差別化、資源の活用拡大などの課題を、分析基盤へどう反映するか検討する必要があります。
<構築済みデータ基盤の投資収益を確保するには >
データ保存量の急増に伴い、情報系インフラの運用費用が課題となっています。多くの企業はライフサイクル管理や圧縮などの対策を導入しています。
高価なアプライアンス運用には費用の壁があります。データをHot・Coldに水平分割すれば、資源の余裕と保存・拡張費の削減が期待できます。大容量・長期保有のColdはHadoop、直近のHotは情報系システムで分析します。
<既存の情報・分析システムとの差別化 >
既存システムとの差別化は共通課題です。従来の分析源は主にレガシーの構造化データですが、ビッグデータ基盤は非構造化・半構造化にも対応し、Kafka・Flink・Spark Streamingでリアルタイム収集を構築できます。
業務で参照する多様な文書・画像を使った統合検索も可能です。テキスト変換とOCRで抽出・前処理・収集・保存を行い、活用範囲を広げられます。

<ビッグデータ資源・基盤の活用を広げるには >
利用者と分析者の双方に活用性・利便性を提供する必要があります。分類、リネージ、オーナーシップ・スチュワードシップ、メタデータ、構造化・非構造化検索、資源管理など、データを探し使う基盤サービスが重要です。
構造化データ向けの従来メタデータツールだけでは不十分です。収集基盤の構築を急ぎ、活用支援に力を入れない結果、既存システムより使われない例もあります。支援サービスと分析基盤が整ってこそ、セルフサービス分析が実現します。

<ビッグデータ環境のデータ・サービスを保護するには >
アクセス性向上と同時に、セキュリティ対策も必要です。従来はITSMで分類別のアクセス権を管理していましたが、分類体系を再構築し、Hadoop内のアクセスを保護・監査する新たな仕組みが求められています。
Cloudera CDPなどでは、Atlas・Rangerを使いWeb UIとAPIでHadoopの分類・権限を管理できます。分析者らが権限を申請しやすくし、機密データを適切に分類して、マスキングとアクセス制御で保護することが重要です。
関連記事: 電子新聞