平成23年度 秋期 午前 問27
データベース
自然言語に関する問題
自然言語の解析などのために,文学作品,会話,新聞記事などの大量の文章を蓄積したテキストデータベースはどれか。なお,生の文章そのものを収集したもの,文法的情報を付加したもの,意味的情報を付加したものなど様々な形態がある。
- アアーカイブズ
- イコーパス
- ウシソーラス
- エハイパテキスト
答えと解説を見る
✓ これが正解イコーパス
解説
研究のために集めた大量の文章そのものです。
設問が描いているのは、文学作品や新聞記事や会話といった、実際に使われた文章を大量に集めて蓄えたものです。自然言語の解析では、言葉が現実にどう使われているかを数え上げるための材料が必要です。その材料になるのが、この集めた文章の山です。設問が後半で、生の文章のまま収めたもの、文法的な情報を付け加えたもの、意味的な情報を付け加えたものと、いくつかの形態を並べているのも手掛かりになります。同じ文章の集まりを土台にして、付け加える情報の厚みだけが違う、という関係になっているからです。四つの語を読み分ける軸は、何を集めたものかという一点です。集めているのが文章そのものなのか、語と語のつながりなのか、それとも保存を目的とした記録の類いなのか。あるいは、そもそも集め方ではなく文書のたどり方を述べた語なのか。この軸で当てていけば、研究用に大量の文章を蓄積したデータベースという説明に重なるのは、用例の集まりを指すコーパスという語だと決まります。なお、言葉を扱う分野では、文章の集まりと、語の関係を整理した辞書とが対になって登場するので、二つを取り違えないようにしておくと役に立ちます。
ほかの選択肢はなぜ違うのか
- アアーカイブズ:保存を目的として集められた記録や資料のまとまりを指す語です。集めて蓄えるという点は共通しますが、言葉の解析に使う材料として文章を集めたもの、という位置づけではありません。
- ウシソーラス:同義の語や、上位と下位の関係など、語どうしのつながりを整理した辞書を指す語です。集めているのが文章ではなく語の関係なので、設問が描く蓄積の形とは中身が違います。
- エハイパテキスト:文書どうしを結び付けて、関連する先へたどれるようにした仕組みを指す語です。蓄積されたものの中身ではなく読み進め方を述べているので、この設問の求めとは軸が違います。
この問題の用語
- データベースたくさんのデータを決まった形で貯め、探したり書き換えたりできるようにした仕組み。多くの人が同時に使うことを前提にしています。
出典:平成23年度 秋期 応用情報技術者試験 午前 問27
この解説に誤りを見つけたら教えてください。直して、直した記録を残します。誤りを報告する(メールが開きます)