マルチタスク学習に向けた高品質データセット構築に関する研究项目来源日本学术振兴会基金(JSPS)项目主持人鈴木 優项目受资助机构岐阜大学项目编号24K03044立项年度2024立项时间未公开研究期限未知 / 未知项目级别国家级受资助金额18590000.00日元学科合同審査対象データベース関連、ウェブ情報学およびサービス情報学関連;ウェブ情報学およびサービス情報学関連;データベース関連学科代码未公开基金类别基盤研究(B)关键词マルチタスク学習;クラウドソーシング;評判分析;教師データ構築;ニューラルネットワーク;大規模データセット;ラベル不均衡問題;機械学習;参与者灘本明代;波多野賢治;参与机构岐阜大学,工学部;甲南大学,知能情報学部;同志社大学,文化情報学部;项目标书摘要:マルチタスク学習における副タスク選定のための評価方法を確立し、初期実験によりその有効性を確認した。主タスクと副タスク候補の教師データを用いたニューラルネットワークの学習過程で得られるパラメータ推移に着目し、k-means法によるクラスタリングを活用して、副タスクの適切性を客観的に評価する仕組みを実装した。さらに、クラウドソーシングを通じた教師データ構築を半自動化するため、分類木によるラベル付与基準を大規模言語モデル(LLM)に入力し、自動的に作業指示を生成するシステムの初期開発を完了した。しかし、人間が直感的に理解可能な作業指示の生成については改善の余地があり、分類精度と直感的理解のバランスを取る手法を現在検討している。これらを基に次年度の本格的な評価実験への準備が整いつつある。マルチタスク学習を用いて機械学習モデルの性能向上を図るために、主タスクの精度を最も効率よく改善できる副タスクの選定方法の確立に取り組んだ。具体的には、評判分析を主タスクとして設定し、主タスクに加えて様々な副タスク候補を準備した上で、それぞれに対応した少量の教師データを用いて予備的な実験を行った。まず、副タスク選定の評価手法として、ニューラルネットワークのパラメータ変化を観察する方法を採用した。主タスクおよび副タスクの教師データをそれぞれ独立にニューラルネットワークモデルに学習させた後、学習中のパラメータの推移を計測した。また、副タスクの設定および教師データ生成に必要なクラウドソーシングプラットフォームの構築にも着手した。特に、ラベル付与の判断基準を自動的に生成するため、分類木によるラベル付与基準を生成し、それを大規模言語モデル(LLM)へ入力することで、作業者への指示文を自動作成するシステムを開発した。さらに、システム基盤としてのクラウドソーシングプラットフォームの初期実装を完了し、一部の実タスクを対象としてテスト運用を行った。具体的には、副タスク候補の教師データ作成のためのクラウドソーシング作業を試験的に実施し、作業者のラベル付け結果と作業依頼者の期待するラベルとの間の差異を観測することによって、作業指示の品質を定量的に評価した。作業指示が適切でない場合にはラベルの差異が拡大することから、この差異を指標として作業指示の改善を繰り返す仕組みを構築しつつある。以上の成果を踏まえ、1年目の研究では、副タスク選定のための基盤技術の構築およびクラウドソーシングによる教師データ生成の初期実装を達成し、これらを統合したシステムの全体的な枠組みを整備することができた。これにより、次年度以降の本格的なマルチタスク学習の実施と大規模データセットによる評価実験への道筋を明確に示した。まず副タスク選定手法の精度と汎用性を高めるため、多様な主タスク・副タスクの組み合わせで実験を拡充する。パラメータ推移に基づく副タスク評価の安定性を検証し、さまざまなテキスト分類課題において有効性を実証する。次に、クラウドソーシングの教師データ作成に関しては、LLMによる作業指示文生成の課題を改善するため、人間が直感的に理解しやすい分類木の構築手法を開発し、分類精度と指示文のわかりやすさの最適なバランスを見出す。これにより、作業者の品質および作業効率の向上を図る。また、副タスクの教師データを大規模かつ効率的に収集するため、1000人規模の作業者が同時に作業可能なクラウドソーシングプラットフォームの本格構築を進める。具体的には、高速性と整合性を両立するため、RDBMSとNoSQLを組み合わせたデータベース基盤を整備し、実環境での性能評価を実施することで実用性を確認する。Reason:マルチタスク学習における副タスク選定のための評価方法を確立し、初期実験によりその有効性を確認した。主タスクと副タスク候補の教師データを用いたニューラルネットワークの学習過程で得られるパラメータ推移に着目し、k-means法によるクラスタリングを活用して、副タスクの適切性を客観的に評価する仕組みを実装した。さらに、クラウドソーシングを通じた教師データ構築を半自動化するため、分類木によるラベル付与基準を大規模言語モデル(LLM)に入力し、自動的に作業指示を生成するシステムの初期開発を完了した。しかし、人間が直感的に理解可能な作業指示の生成については改善の余地があり、分類精度と直感的理解のバランスを取る手法を現在検討している。これらを基に次年度の本格的な評価実験への準備が整いつつある。Outline of · · · Start:本研究では,マルチタスク学習と呼ばれる方法で機械学習の精度向上に必要なデータセットの構築を行う.マルチタスク学習では,二つ以上の問題をまとめて解くことによって精度が向上することが知られているが,どのような問題を組み合わせると精度が向上するかは自明ではない.そこで,相性の良い問題,悪い問題の傾向について明らかにすると共に,データセットの構築を行うことがこの研究の目的である.クラウドソーシングによりデータセットを構築することにより,安価で高精度なデータセット構築が可能となる.評判分析を一つのテストケースとして用い,既存手法で60%程度の精度であったものを80%程度まで向上させることを目指す。排序方式: 时间 相关性显示方式: 列表 摘要0/排序方式: 时间 相关性显示方式: 列表 摘要0/