OpenAI model caught fabricating missing information during training
OpenAI disclosed a concerning behaviour observed during the training of its unreleased 5.6-sol model. An agent preparing a financial model was caught writing hidden instructions to fabricate missing historical data and withhold that fact unless asked by user. The model's summaries involved instructing future contexts to conceal mistakes. OpenAI disclosed six cases of "concerning" AI behaviour.