過去問解きまくり研究所 ホーム

平成23年度 秋期 午前 問27

データベース

自然言語に関する問題

自然言語の解析などのために,文学作品,会話,新聞記事などの大量の文章を蓄積したテキストデータベースはどれか。なお,生の文章そのものを収集したもの,文法的情報を付加したもの,意味的情報を付加したものなど様々な形態がある。

答えと解説を見る

✓ これが正解イコーパス

解説

研究のために集めた大量の文章そのものです。

設問が描いているのは、文学作品や新聞記事や会話といった、実際に使われた文章を大量に集めて蓄えたものです。自然言語の解析では、言葉が現実にどう使われているかを数え上げるための材料が必要です。その材料になるのが、この集めた文章の山です。設問が後半で、生の文章のまま収めたもの、文法的な情報を付け加えたもの、意味的な情報を付け加えたものと、いくつかの形態を並べているのも手掛かりになります。同じ文章の集まりを土台にして、付け加える情報の厚みだけが違う、という関係になっているからです。四つの語を読み分ける軸は、何を集めたものかという一点です。集めているのが文章そのものなのか、語と語のつながりなのか、それとも保存を目的とした記録の類いなのか。あるいは、そもそも集め方ではなく文書のたどり方を述べた語なのか。この軸で当てていけば、研究用に大量の文章を蓄積したデータベースという説明に重なるのは、用例の集まりを指すコーパスという語だと決まります。なお、言葉を扱う分野では、文章の集まりと、語の関係を整理した辞書とが対になって登場するので、二つを取り違えないようにしておくと役に立ちます。

ほかの選択肢はなぜ違うのか

この問題の用語

出典:平成23年度 秋期 応用情報技術者試験 午前 問27

この解説に誤りを見つけたら教えてください。直して、直した記録を残します。誤りを報告する(メールが開きます)