API を完全に開放してくれて、自動学習をコーパスから行えるような漢字変換があるとよいのだけどなぁ。自分で書いた文書を大量に食わせてやると、それに最適化した学習を行ってくれるようなものがほしいわけだが。そうすると、その前提となるのが、食わせた文章をひらがな文字列にいったん直すための解析器ということになる。ところが、鶏が先か卵が先かで、それを正確にやるためには、ちゃんとした辞書が必要だったりすると。MeCab や ChaSen などのような形態素解析器を使っても正しい読みをちゃんとつけられないことも多いから、難しいところがある。でも、ここで発想の転換をして、入力文字列をすべて保存して、それを元に解析させるという手もある。いや、それって単なる学習じゃないという話もあるのだが、入力をすべて書き出して、その結果もすべて書き出せるような API があって開放されていて、いろんな人の入力を一箇所に集めることができたら、大量のコーパスができてしまうじゃないという話もあるのではないか。そうすると、日本語入力もやっぱりオープンソースのものをちょっと改造して無理にでも使ってという方向もあるんじゃないかなぁと思う今日この頃であった。学習情報の多元化。けっきょく、コーパスを作ること、学習すること、使うことが一体化してないと実用的でないとか思える。
最近見た映画
TAXi3、イナフ、キャッチミー・イフ・ユー・キャン、KT、完全犯罪クラブ、ロード・オブ・ザ・リング-二つの塔、ハリーポッターと秘密の部屋、レッド・ドラゴン、猟奇的な彼女、SPY_N、リターナー、魔界転生(窪塚洋介/佐藤浩市版)、凶気の桜、チンピラ TWO PUNKS。忙しいとかなんだかんだいいながら、そこそこのの量を見ているのであった。そういえば、リターナー(*)で鈴木杏が出ているのだが、やたらかわいかった。花とアリスは、劇場公開も決まったらしいが、ショートフィルム版が BREAK TOWN で第3章まで公開されている。これネスレの広告になっていて、おもしろいやり方ね。